跳到正文

#模型发布

今日 0 条
6月22日周一
6月17日周三
  1. Hugging Face Blog86

    智谱发布 GLM-5.2:支持 1M 上下文的长程任务旗舰模型

    智谱(Z.ai)发布最新旗舰模型 GLM-5.2,主打长程任务处理能力并首次提供稳定的 1M-token 上下文窗口。该模型采用 IndexShare 架构降低计算成本,在 FrontierSWE、PostTrainBench 等长程编码基准中表现优于多数闭源模型,成为排名第一的开源模型。

    推荐理由:原文给出了1M上下文在长程编码任务中的实测表现与架构优化细节,读者可以据此判断其作为开源旗舰模型的实际工程落地能力。

6月11日周四
  1. Google DeepMind80

    Google DeepMind 发布 DiffusionGemma:文本生成速度提升4倍的实验性开源模型

    Google DeepMind 推出基于扩散模型的实验性开源模型 DiffusionGemma,在专用 GPU 上实现最高 4 倍的文本生成加速。该模型采用 Apache 2.0 许可证,拥有 26B 总参数但仅激活 3.8B 参数,支持双向注意力以优化代码填充和非线性文本结构生成,目前主要面向追求低延迟的本地交互式应用场景。

    推荐理由:该实验性模型通过并行生成机制将本地推理速度提升4倍,为开发者探索低延迟交互工作流提供了新的技术路径。

6月9日周二
  1. Google DeepMind82

    Google DeepMind 发布 Gemma 4 12B:统一无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,这是一款旨在笔记本电脑上运行的高性能多模态模型。它采用独特的无编码器统一架构,将视觉和音频输入直接融入 LLM 主干网络,支持原生音频输入。

    推荐理由:该模型采用无编码器统一架构,在16GB显存设备上实现接近26B MoE的多模态推理能力,适合关注本地部署效率的开发者。

6月5日周五
  1. Hugging Face Blog65

    NVIDIA 发布 Nemotron 3.5 Content Safety:支持自定义策略的多模态内容安全模型

    NVIDIA 发布 Nemotron 3.5 Content Safety,这是一个基于 Gemma 3 4B IT 微调的统一多模态、多语言内容安全模型。它支持自定义企业策略执行和可选的可审计推理轨迹(THINK Mode),在保持低延迟的同时实现了跨语言和图文的综合安全评估。

    推荐理由:该模型将多模态、多语言与自定义策略执行统一于单次推理,并开源了包含真实图像的训练数据集,为企业级内容安全提供了可审计且低延迟的解决方案。

6月2日周二
  1. Hugging Face Blog75

    Holo3.1 系列模型发布:支持快速本地推理的计算机使用智能体

    Hcompany 发布 Holo3.1 系列计算机使用模型,旨在提升在 Web、桌面和移动环境以及不同 Agent 框架下的鲁棒性。该系列包含 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次提供 FP8、Q4 GGUF 和 NVFP4 量化检查点以支持本地推理。

    推荐理由:原文给出了跨环境鲁棒性提升及首次发布的量化权重,读者可据此评估本地化部署的可行性与性能损耗。

6月1日周一
  1. Hugging Face Blog57

    JetBrains 发布 Mellum2:12B 参数混合专家模型

    JetBrains 发布了 Mellum2,这是一个拥有 120 亿参数的混合专家(MoE)模型,每个 token 仅激活 25 亿参数。该模型基于 Apache 2.0 许可证开源,专注于文本和代码任务,相比同尺寸模型推理速度提升超过 2 倍。Mellum2 适用于路由、RAG、子智能体及私有部署等高频低延迟场景,旨在作为大型 AI 系统中的高效组件而非替代所有模型。

5月22日周五
5月20日周三
5月19日周二
5月18日周一
  1. Google DeepMind86

    Google DeepMind 发布 Gemini Omni Flash 模型

    Google DeepMind 推出 Gemini Omni Flash,这是 Omni 系列的首个模型,支持从图像、音频、视频和文本等任意输入生成高质量视频。

    推荐理由:原文详细说明了 Gemini Omni Flash 支持自然语言对话式视频编辑及多模态输入生成,并给出了具体的分发渠道和订阅权限。

5月16日周六
  1. Google DeepMind92

    Google DeepMind 发布 Gemini 3.5 Flash 模型

    Google DeepMind 正式发布 Gemini 3.5 系列并率先推出 Gemini 3.5 Flash 模型,该模型主打智能体(Agent)与编码能力,现已向全球用户开放。

    推荐理由:官方详细披露了 Gemini 3.5 Flash 在智能体任务与编码基准上的性能数据及开放入口,为评估其实际工作流替代能力提供了具体依据。

5月15日周五
5月7日周四
  1. OpenAI News62

    OpenAI 发布新语音模型

    OpenAI 在官方博客宣布推出新的语音模型。该更新旨在增强音频处理与交互能力,具体技术细节和可用接口需参考原文进一步确认。

    推荐理由:OpenAI 官方宣布推出新的语音模型,为开发者提供了最新的音频处理能力入口。

5月5日周二
  1. OpenAI News65

    OpenAI 发布新模型

    OpenAI 通过官方新闻渠道发布了一款新模型。由于提供的正文内容缺失具体细节,无法确定该模型的名称、版本或特定功能更新。

    推荐理由:官方渠道直接发布了新模型信息,读者可第一时间获取来自源头的准确参数与能力说明。

4月30日周四
4月29日周三
  1. Hugging Face Blog70

    IBM Granite 4.1 LLMs 技术详解:构建过程与性能表现

    IBM 发布 Granite 4.1 系列大语言模型(3B、8B、30B),采用 Apache 2.0 许可证开源。该系列基于约 15T tokens 进行五阶段预训练,上下文窗口扩展至 512K,并通过监督微调和多阶段强化学习优化。其中 8B 稠密模型在指令遵循和工具调用等任务上表现匹敌甚至超越前代 32B MoE 模型,提供了可预测的延迟和更低成本的企业级解决方案。

    推荐理由:原文详细拆解了从预训练到多阶段强化学习的全流程,展示了如何通过严格的数据工程让8B稠密模型在多项指标上匹敌32B MoE架构。

4月28日周二
  1. Hugging Face Blog78

    NVIDIA 发布 Nemotron 3 Nano Omni 全模态模型

    NVIDIA 发布 Nemotron 3 Nano Omni,这是一款支持文本、图像、视频和音频的全模态理解模型。该模型采用 Mamba-Transformer MoE 混合骨干网络,在 OCRBenchV2 和 WorldSense 等基准测试中表现优异,并针对长文档分析和智能体计算机使用进行了优化。BF16、FP8 和 NVFP4 检查点已在 Hugging Face 开放下载。

    推荐理由:原文给出了混合架构细节与多基准实测数据,读者可以据此评估其在长文档和音视频联合理解任务中的实际能力边界。

4月24日周五
  1. Hugging Face Blog95

    DeepSeek-V4 发布:支持百万 token 上下文且专为智能体优化的开源模型

    DeepSeek 发布 V4 系列模型,包含 DeepSeek-V4-Pro(1.6T 总参数/49B 激活)和 DeepSeek-V4-Flash(284B 总参数/13B 激活),均支持 1M-token 上下文窗口。

    推荐理由:原文详细拆解了 DeepSeek-V4 通过混合注意力机制大幅降低长上下文推理成本的技术细节,并展示了其在智能体任务中的具体性能表现。

4月23日周四
  1. OpenAI News62

    OpenAI 发布新模型

    OpenAI 官方宣布发布一款新模型。目前公开信息主要确认了发布事件本身,具体的技术参数、基准测试成绩或应用场景细节未在简短公告中展开。

    推荐理由:OpenAI 官方发布了新模型,读者可关注其具体能力变化及在现有生态中的定位。

4月22日周三
4月16日周四
  1. Google DeepMind70

    Google DeepMind 发布 Gemini 3.1 Flash TTS 支持细粒度音频标签控制

    Google DeepMind 推出最新文本转语音模型 Gemini 3.1 Flash TTS,即日起在 Gemini API、Google AI Studio 和 Vertex AI 预览版中向开发者和企业开放。

    推荐理由:新模型引入自然语言音频标签以精细控制语调节奏,并在 Artificial Analysis 榜单取得高分,适合评估其在多语言场景下的表现力与成本平衡。

4月13日周一
  1. Google DeepMind73

    Google DeepMind 发布 Gemini Robotics-ER 1.6 增强机器人具身推理能力

    Google DeepMind 推出 Gemini Robotics-ER 1.6,这是一款专为机器人设计的高层推理模型,显著提升了空间推理和多视角理解能力。该模型新增了仪表读取功能,能够解读复杂压力表和液位计,并在指向、计数及任务成功检测方面优于前代版本。

    推荐理由:官方详细拆解了空间推理与仪表读取等核心能力,并给出了 API 入口及开发者示例,适合评估其在工业巡检场景的落地潜力。

4月9日周四
  1. Hugging Face Blog65

    Overworld 发布 Waypoint-1.5:面向消费级 GPU 的高保真实时交互世界模型

    Overworld 发布新一代实时视频世界模型 Waypoint-1.5,旨在让交互式生成世界能在用户现有的消费级硬件上运行。该模型提供两个版本:720p/60 FPS 版本适用于 RTX 3090 至 5090 等高性能桌面显卡,360p 版本则针对游戏笔记本及即将支持的 Apple Silicon Macs 优化以覆盖更广泛的设备。

    推荐理由:原文给出了在消费级硬件上运行实时交互世界模型的具体参数与双版本策略,读者可据此评估本地部署的可行性。

4月3日周五
  1. Google DeepMind90

    Google DeepMind 发布 Gemma 4:号称每字节性能最强的开源模型家族

    Google DeepMind 正式推出 Gemma 4 系列开源大模型,包含 E2B、E4B、26B MoE 和 31B Dense 四种规格,采用 Apache 2.0 许可证。

    推荐理由:Google DeepMind 发布 Gemma 4 系列开源模型,提供从移动端到工作站的多种尺寸及 Apache 2.0 许可,展示了其在智能体工作流和边缘计算上的最新进展。

4月2日周四
  1. Hugging Face Blog96

    Gemma 4 系列多模态模型发布

    Gemma 4 系列多模态模型正式发布,包含 E2B、E4B、12B Unified、31B 和 26B A4B 五种尺寸,支持图像、文本和音频输入,采用 Apache 2.0 许可证。

    推荐理由:原文给出了五种尺寸的多模态架构细节与跨框架部署方案,读者可据此评估其在端侧推理和智能体工作流中的实际可用性。

4月1日周三
  1. Hugging Face Blog70

    TII 发布 Falcon Perception 0.6B 早期融合模型及 Falcon OCR 0.3B 模型

    Technology Innovation Institute (TII) 发布 Falcon Perception(0.6B 参数)和 Falcon OCR(0.3B 参数),两者均采用单一早期融合 Transformer 架构处理图像补丁与文本。

    推荐理由:原文展示了早期融合架构在开放词汇分割与OCR任务上的性能优势及推理细节,为小参数模型替代复杂视觉管线提供了可复用的技术路径。

3月31日周二
3月26日周四
  1. Google DeepMind80

    Google DeepMind 发布 Gemini 3.1 Flash Live 语音模型

    Google DeepMind 发布 Gemini 3.1 Flash Live,这是其最高质量的音频和语音模型,旨在提供更自然、低延迟的实时对话体验。

    推荐理由:原文给出了新语音模型在复杂任务基准上的具体得分及多语言实时对话能力的扩展,读者可据此评估其在构建高可靠性语音智能体时的实际性能提升。

  2. Google DeepMind68

    Google DeepMind 发布 Lyria 3 Pro 音乐生成模型

    Google DeepMind 推出 Lyria 3 Pro,这是其最先进的音乐生成模型,支持创建长达 3 分钟的曲目,并能理解前奏、主歌、副歌等音乐结构以提供更强的定制化和创意控制。

    推荐理由:Lyria 3 Pro 支持长达 3 分钟的曲目生成并具备结构感知能力,同时接入 Vertex AI、Gemini 等多个平台,为不同规模的用户提供了更精细的音乐创作控制。

3月24日周二
  1. Mistral AI73

    Mistral AI 发布 Voxtral TTS 文本转语音模型

    Mistral AI 推出首个文本转语音模型 Voxtral TTS,参数量为 4B,支持英语、法语等 9 种语言的情感化语音生成。该模型具备极低延迟(70ms)和零样本跨语言声音适应能力,在人类评估中自然度优于 ElevenLabs Flash v2.5。

    推荐理由:原文给出了多语言情感表达、低延迟指标及与竞品的对比评测,读者可据此评估其在企业级语音智能体工作流中的实际落地能力。

3月17日周二
  1. OpenAI News62

    OpenAI 发布新模型

    OpenAI 官方宣布发布一款新模型。该消息源自 OpenAI News,具体型号名称、版本细节及性能指标未在提供的材料中明确列出。

    推荐理由:OpenAI 官方发布了新模型,读者可据此了解其最新能力进展及在现有工作流中的潜在应用价值。

3月10日周二
3月7日周六
  1. Google Research45

    Google 开源 SpeciesNet:基于 6500 万张图像训练,可识别 2498 类野生动物

    Google Research 发布开源 AI 模型 SpeciesNet,利用 6500 万张标注图像训练,能自动识别相机陷阱照片中的 2498 类动物。该模型在标准笔记本上日处理约 30,000 张图片,对含动物图像的检出率达 99.4%,物种级分类准确率为 94.5%。作为 Google Earth AI 的一部分,SpeciesNet 已支持全球多个保护项目加速野生动物监测与分析。

3月5日周四
  1. OpenAI News80

    OpenAI 发布新模型

    OpenAI 正式发布了最新的大语言模型。该更新由 OpenAI News 官方渠道确认,标志着其前沿智能能力的进一步迭代。

    推荐理由:官方直接发布了新模型,读者可第一时间获取其核心能力定义与接入方式。

3月4日周三
  1. Google DeepMind73

    Google DeepMind 发布 Gemini 3.1 Flash-Lite 模型

    Google DeepMind 推出 Gemini 3.1 Flash-Lite,这是其最快且最具成本效益的 Gemini 3 系列模型,现已通过 Gemini API 和 Vertex AI 向开发者和企业开放预览。

    推荐理由:官方公布 Gemini 3.1 Flash-Lite 的定价、速度提升及基准测试数据,为高并发场景下的模型选型提供具体参考。