跳到正文

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

221条精选相关主题产品更新论文研究开源生态

最新精选

第 81–100 条 · 共 221 条
3月4日周三
  1. Google DeepMind73

    Google DeepMind 发布 Gemini 3.1 Flash-Lite 模型

    Google DeepMind 推出 Gemini 3.1 Flash-Lite,这是其最快且最具成本效益的 Gemini 3 系列模型,现已通过 Gemini API 和 Vertex AI 向开发者和企业开放预览。

    推荐理由:官方公布 Gemini 3.1 Flash-Lite 的定价、速度提升及基准测试数据,为高并发场景下的模型选型提供具体参考。

2月27日周五
2月20日周五
  1. Google DeepMind86

    Google DeepMind 发布 Gemini 3.1 Pro 模型

    Google DeepMind 正式发布 Gemini 3.1 Pro,作为 Gemini 3 系列的核心智能升级版本。该模型在 ARC-AGI-2 基准测试中取得 77.1% 的验证分数,推理性能较前代提升超过一倍。

    推荐理由:原文披露了 Gemini 3.1 Pro 在 ARC-AGI-2 基准上的具体得分及全平台开放入口,读者可据此评估其推理能力跃升幅度与当前可用性。

2月13日周五
  1. OpenAI News62

    GPT-5.2 推导出理论物理学新结果

    OpenAI 宣布 GPT-5.2 在理论物理领域推导出一项新结果。一份新的预印本显示,GPT-5.2 提出了一个胶子振幅的新公式,该公式随后由 OpenAI 和学术合作者正式证明并验证。

    推荐理由:官方展示了 GPT-5.2 在理论物理领域提出新公式并被验证的案例,体现了大模型在前沿科学推理中的潜在能力。

  2. Google DeepMind82

    Google DeepMind 发布 Gemini 3 Deep Think 重大升级

    Google DeepMind 发布 Gemini 3 Deep Think 的重大升级,该专用推理模式旨在解决科学、研究和工程领域的现代挑战。新版本在 Humanity’s Last Exam(48.4%)、ARC-AGI-2(84.6%)和 Codeforces(Elo 3455)等基准测试中创下新高,并在国际物理和化学奥林匹克笔试部分达到金牌水平。

    推荐理由:官方公布了Deep Think在科学、工程和数学基准上的最新性能数据及API开放计划,为评估其解决复杂现实问题的能力提供了具体依据。

2月12日周四
  1. OpenAI News67

    OpenAI 发布 GPT-5.3-Codex-Spark 实时编码模型

    OpenAI 推出首个实时编码模型 GPT-5.3-Codex-Spark,生成速度提升 15 倍,支持 128k 上下文窗口。该模型目前以研究预览形式向 ChatGPT Pro 用户开放。

    推荐理由:官方发布了首款实时编码模型,提供了具体的速度提升倍数和上下文窗口参数,适合开发者评估其在编程场景下的响应效率。

2月5日周四
  1. OpenAI News70

    OpenAI 发布 GPT-5.3-Codex

    OpenAI 发布 GPT-5.3-Codex,这是一款专为 Codex 设计的智能体模型。它将前沿编码性能与通用推理相结合,旨在支持长周期的真实世界技术工作。

    推荐理由:官方明确该模型专为 Codex 设计,结合前沿编码与通用推理以支持长周期技术工作。

1月20日周二
  1. Hugging Face Blog80

    Overworld 发布实时交互式视频扩散模型 Waypoint-1

    Overworld 推出实时交互式视频扩散模型 Waypoint-1,支持通过文本、鼠标和键盘进行零延迟控制。该模型基于帧因果整流流 Transformer 架构,在 10,000 小时游戏画面数据上从头开始训练,专注于交互体验而非简单的微调。

    推荐理由:原文详细说明了从预训练到推理优化的技术路径,并给出了在消费级硬件上实现零延迟交互的具体性能数据。

1月14日周三
  1. Google Research65

    Google 发布 MedGemma 1.5 4B 与 MedASR 开源医疗模型

    Google Research 发布 MedGemma 1.5 4B 模型和 MedASR 语音识别模型,并启动 Kaggle 黑客松。MedGemma 1.5 新增对 CT、MRI 和全切片病理图像等高维医学影像的解读能力,在内部基准测试中疾病分类准确率较上一代显著提升;MedASR 专为医疗听写微调,错误率远低于通用 Whisper large-v3 模型。

    推荐理由:原文给出了MedGemma 1.5对CT和MRI等高维医学影像的支持及具体基准提升,开发者可据此评估其在复杂医疗场景中的适配潜力。

1月6日周二
12月18日周四
  1. OpenAI News78

    OpenAI 发布 GPT-5.2-Codex 编程模型

    OpenAI 推出其最先进的编程模型 GPT-5.2-Codex。该模型支持长程推理和大规模代码转换,并增强了网络安全相关能力。

    推荐理由:官方明确该模型具备长程推理、大规模代码转换及增强的网络安全能力,为开发者评估其在复杂工程任务中的表现提供了核心依据。

12月17日周三
  1. Mistral AI60

    Mistral AI 发布 Mistral OCR 3 模型

    Mistral AI 正式发布 Mistral OCR 3,该模型在表单、扫描文档、复杂表格和手写内容上的整体胜率比 Mistral OCR 2 高出 74%。

    推荐理由:Mistral OCR 3 在表单、手写和复杂表格识别上较前代有显著提升,且以极低价格提供 API 服务,适合需要高精度文档解析的开发者评估。

  2. Google DeepMind86

    Google DeepMind 发布 Gemini 3 Flash:兼顾前沿智能与速度

    Google DeepMind 发布 Gemini 3 Flash,旨在以更低成本和更高速度提供接近 Pro 级别的前沿智能。该模型在 GPQA Diamond 得分 90.4%,SWE-bench Verified 得分 78%,比 Gemini 2.5 Pro 快 3 倍且平均少用 30% token。

    推荐理由:原文给出了 Gemini 3 Flash 在多项基准测试中的具体分数、定价及与上一代模型的性能对比,读者可据此评估其在速度与成本平衡上的实际竞争力。

12月13日周六
12月11日周四
  1. OpenAI News70

    OpenAI 发布 GPT-5.2:强化科学与数学能力

    OpenAI 发布 GPT-5.2,称其为迄今在数学和科学领域最强的模型。该模型在 GPQA Diamond 和 FrontierMath 等基准测试中创下新的 SOTA 结果。官方展示其能解决开放理论问题并生成可靠的数学证明,推动实际科研进展。

    推荐理由:原文指出GPT-5.2在GPQA Diamond和FrontierMath等基准上刷新纪录,并展示了其在解决开放理论问题和生成可靠数学证明方面的实际科研进展。

  2. OpenAI News74

    OpenAI 发布 GPT-5.2 模型

    OpenAI 正式发布 GPT-5.2 模型,定位为面向专业工作的新一代前沿模型。该版本在推理、编码和长上下文理解方面进行了优化,旨在提升复杂任务的处理效率与可靠性。

    推荐理由:OpenAI 官方宣布推出 GPT-5.2,强调其在专业工作场景下的推理与编码能力升级。

12月9日周二
12月3日周三
  1. Mistral AI87

    Mistral AI 发布 Mistral 3 系列开源模型

    Mistral AI 正式推出下一代模型家族 Mistral 3,包括 Mistral Large 3(41B 激活/675B 总参数的稀疏 MoE)以及 Ministral 3 系列(3B、8B、14B 密集模型)。

    推荐理由:官方发布了包含稀疏 MoE 大模型和密集小模型的 Mistral 3 系列,全部采用 Apache 2.0 协议开源并支持多模态与推理能力。

12月1日周一
  1. Hugging Face Blog80

    Hugging Face Transformers v5 发布:聚焦简洁性、训练、推理与生产环境

    Hugging Face 正式发布 Transformers v5.0.0rc-0,该版本将安装量提升至日均 300 万次并支持超过 400 种模型架构。v5 重点优化了代码简洁性与模块化设计,移除 Flax/TensorFlow 支持以专注 PyTorch 后端,并引入 transformers serve 新 API 及原生量化支持以提升推理与生产环境的互操作性。

    推荐理由:官方详解 v5 版本在简化代码、统一后端及增强推理与量化支持方面的核心变化,为开发者评估迁移成本与生态兼容性提供直接依据。