跳到正文

#Agent

今日 1 条
今天10月2日周五
10月1日周四
  1. Google DeepMind94

    Google DeepMind 发布 Gemini 4 Argon 模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,旨在提升复杂工作流中的深度推理能力,并已通过 Fairwind Program 向受信任的网络安全防御者推出。

    推荐理由:原文披露了 Gemini 4 Argon 在长上下文输出、软件工程基准及网络安全防御上的具体性能数据与分阶段开放策略,为评估前沿模型能力边界提供了直接依据。

9月23日周三
9月16日周三
9月3日周四
  1. Google DeepMind86

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 推出 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber 两款新模型,前者主打智能体工作流与编码,后者专攻网络安全防御。

    推荐理由:原文给出了两款新模型在长周期编码和网络安全领域的具体基准表现及定价,读者可据此评估其在自动化工作流中的实际效能与成本优势。

8月25日周二
  1. Hugging Face Blog71

    IBM Granite 4.2 LLMs 构建技术详解

    IBM 发布 Granite 4.2 推理模型家族,包含 3B、8B 和 30B 三种尺寸,均基于 Apache 2.0 许可证开源。这些模型通过五阶段策略在约 15T tokens 上预训练,并经过监督微调及多阶段强化学习管道训练,其中 8B 和 30B 版本额外进行了智能体强化学习以支持工具调用。所有模型均支持思考/非思考模式切换及原生工具调用,可通过 vLLM 等框架部署。

    推荐理由:原文详细拆解了从预训练到多阶段强化学习的完整技术路径,为开发者提供了复现或评估该系列模型能力的具体参考。

8月14日周五
  1. Google DeepMind84

    Google DeepMind 发布 Gemini 3.7 Flash

    Google DeepMind 发布 Gemini 3.7 Flash,这是其针对编码和智能体任务的最强主力模型。该版本在 FrontierCode 1.1 Main(43.6% vs 34.4%)和 DeepSWE v1.1(65.3% vs 49.0%)等基准上显著优于前代,并支持更高效的 Web 开发工作流。

    推荐理由:原文给出了新模型在编码与智能体任务上的具体基准提升及减半的入门价格,读者可据此评估其性价比。

8月10日周一
  1. Hugging Face Blog92

    Meta 发布 Muse Glimmer:面向本地智能体的开源多模态模型

    Meta 发布 Muse Glimmer,这是一个专为本地智能体用例设计的 30B 参数多模态模型,采用 Apache 2.0 许可证开源。该模型由 Muse 蒸馏而来,包含 2B ViT 视觉编码器和 28B 文本解码器,支持图像、视频输入及多模态工具调用。

    推荐理由:原文给出了30B参数模型的架构细节、基准测试数据及在主流推理框架中的Day-0支持,读者可据此评估其在本地智能体场景下的实际部署能力。

7月21日周二
  1. Google DeepMind82

    Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber

    Google DeepMind 正式推出 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三款新模型,旨在优化 AI 智能体的构建效率与成本。

    推荐理由:官方详细披露了新版 Flash 系列模型的 token 效率提升数据、具体定价及计算机使用能力内置情况,为开发者评估智能体工作流的成本与性能提供了直接依据。

6月2日周二
  1. Hugging Face Blog75

    Holo3.1 系列模型发布:支持快速本地推理的计算机使用智能体

    Hcompany 发布 Holo3.1 系列计算机使用模型,旨在提升在 Web、桌面和移动环境以及不同 Agent 框架下的鲁棒性。该系列包含 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次提供 FP8、Q4 GGUF 和 NVFP4 量化检查点以支持本地推理。

    推荐理由:原文给出了跨环境鲁棒性提升及首次发布的量化权重,读者可据此评估本地化部署的可行性与性能损耗。

5月16日周六
  1. Google DeepMind92

    Google DeepMind 发布 Gemini 3.5 Flash 模型

    Google DeepMind 正式发布 Gemini 3.5 系列并率先推出 Gemini 3.5 Flash 模型,该模型主打智能体(Agent)与编码能力,现已向全球用户开放。

    推荐理由:官方详细披露了 Gemini 3.5 Flash 在智能体任务与编码基准上的性能数据及开放入口,为评估其实际工作流替代能力提供了具体依据。

4月28日周二
  1. Hugging Face Blog78

    NVIDIA 发布 Nemotron 3 Nano Omni 全模态模型

    NVIDIA 发布 Nemotron 3 Nano Omni,这是一款支持文本、图像、视频和音频的全模态理解模型。该模型采用 Mamba-Transformer MoE 混合骨干网络,在 OCRBenchV2 和 WorldSense 等基准测试中表现优异,并针对长文档分析和智能体计算机使用进行了优化。BF16、FP8 和 NVFP4 检查点已在 Hugging Face 开放下载。

    推荐理由:原文给出了混合架构细节与多基准实测数据,读者可以据此评估其在长文档和音视频联合理解任务中的实际能力边界。

4月24日周五
  1. Hugging Face Blog95

    DeepSeek-V4 发布:支持百万 token 上下文且专为智能体优化的开源模型

    DeepSeek 发布 V4 系列模型,包含 DeepSeek-V4-Pro(1.6T 总参数/49B 激活)和 DeepSeek-V4-Flash(284B 总参数/13B 激活),均支持 1M-token 上下文窗口。

    推荐理由:原文详细拆解了 DeepSeek-V4 通过混合注意力机制大幅降低长上下文推理成本的技术细节,并展示了其在智能体任务中的具体性能表现。

4月3日周五
  1. Google DeepMind90

    Google DeepMind 发布 Gemma 4:号称每字节性能最强的开源模型家族

    Google DeepMind 正式推出 Gemma 4 系列开源大模型,包含 E2B、E4B、26B MoE 和 31B Dense 四种规格,采用 Apache 2.0 许可证。

    推荐理由:Google DeepMind 发布 Gemma 4 系列开源模型,提供从移动端到工作站的多种尺寸及 Apache 2.0 许可,展示了其在智能体工作流和边缘计算上的最新进展。

3月26日周四
  1. Google DeepMind80

    Google DeepMind 发布 Gemini 3.1 Flash Live 语音模型

    Google DeepMind 发布 Gemini 3.1 Flash Live,这是其最高质量的音频和语音模型,旨在提供更自然、低延迟的实时对话体验。

    推荐理由:原文给出了新语音模型在复杂任务基准上的具体得分及多语言实时对话能力的扩展,读者可据此评估其在构建高可靠性语音智能体时的实际性能提升。

3月24日周二
  1. Mistral AI73

    Mistral AI 发布 Voxtral TTS 文本转语音模型

    Mistral AI 推出首个文本转语音模型 Voxtral TTS,参数量为 4B,支持英语、法语等 9 种语言的情感化语音生成。该模型具备极低延迟(70ms)和零样本跨语言声音适应能力,在人类评估中自然度优于 ElevenLabs Flash v2.5。

    推荐理由:原文给出了多语言情感表达、低延迟指标及与竞品的对比评测,读者可据此评估其在企业级语音智能体工作流中的实际落地能力。

3月17日周二
2月10日周二
  1. Google DeepMind84

    Google DeepMind 发布两篇论文:Gemini Deep Think 加速数学与科学发现

    Google DeepMind 发布两篇研究论文,展示 Gemini Deep Think 模式在专家指导下解决数学、物理和计算机科学领域专业研究问题的能力。

    推荐理由:原文展示了 Gemini Deep Think 在纯数学、物理和计算机科学领域的具体科研突破案例及人机协作方法论,为评估 AI 在专业科研中的实际能力提供了详实依据。

12月17日周三
  1. Google DeepMind86

    Google DeepMind 发布 Gemini 3 Flash:兼顾前沿智能与速度

    Google DeepMind 发布 Gemini 3 Flash,旨在以更低成本和更高速度提供接近 Pro 级别的前沿智能。该模型在 GPQA Diamond 得分 90.4%,SWE-bench Verified 得分 78%,比 Gemini 2.5 Pro 快 3 倍且平均少用 30% token。

    推荐理由:原文给出了 Gemini 3 Flash 在多项基准测试中的具体分数、定价及与上一代模型的性能对比,读者可据此评估其在速度与成本平衡上的实际竞争力。

12月13日周六
11月19日周三
8月5日周二
  1. Hugging Face Blog98

    Hugging Face 欢迎 OpenAI 开源 GPT OSS 模型家族

    OpenAI 发布了名为 GPT OSS 的开源权重模型家族,包含 gpt-oss-120b 和 gpt-oss-20b 两个混合专家(MoE)模型,均采用 MXFP4 量化并遵循 Apache 2.0 许可证。

    推荐理由:原文详细说明了 GPT OSS 的架构特性、量化方案及在主流框架下的本地部署与微调方法,为开发者提供了从云端 API 到端侧运行的完整技术路径。

6月3日周二
  1. Hugging Face Blog65

    H Company 发布 Holo1 GUI 自动化 VLM 家族及 Surfer-H 智能体

    H Company 在 Hugging Face Hub 上发布了 Holo1 系列动作视觉语言模型(Action VLMs)和 WebClick 基准测试。该系列包含 Holo1-3B 和 Holo1-7B 两个版本,基于 Qwen2.5-VL 架构,其中 Holo1-7B 在通用 UI 定位基准上达到 76.2% 的平均准确率。

    推荐理由:原文发布了专为GUI自动化设计的开源视觉语言模型家族及基准,提供了低成本实现网页任务自动化的具体性能数据。