Google DeepMind 发布升级版 Gemini 2.5 Flash Native Audio 模型
Google DeepMind 发布升级版 Gemini 2.5 Flash Native Audio 模型,旨在优化实时语音代理的自然对话与复杂任务处理能力。
推荐理由:官方更新了 Gemini 2.5 Flash Native Audio 模型,显著提升了实时语音代理在复杂工作流处理、指令遵循及多轮对话中的表现。
Google DeepMind 发布升级版 Gemini 2.5 Flash Native Audio 模型,旨在优化实时语音代理的自然对话与复杂任务处理能力。
推荐理由:官方更新了 Gemini 2.5 Flash Native Audio 模型,显著提升了实时语音代理在复杂工作流处理、指令遵循及多轮对话中的表现。
Google 联合 SisonkeBiotik 等社区举办非洲健康数据科学 Ideathon,鼓励利用 MedGemma、TxGemma 和 MedSigLIP 解决本地医疗挑战。冠军 Dawa Health 基于 MedSigLIP 与 Gemini RAG 构建宫颈癌筛查工具,计划明年扩展至 50,000 名患者。
OpenAI 利用 Codex 在 28 天内完成了 Sora for Android 的开发与发布。通过 AI 辅助的规划、代码翻译及并行编码工作流,敏捷团队实现了快速且可靠的交付。
BNY 利用 OpenAI 技术通过 Eliza 平台在全企业范围内扩展 AI 应用,已有超过 20,000 名员工使用该工具构建 AI 智能体。这些由员工创建的 AI 智能体旨在提升运营效率并改善客户服务成果,实现了“人人可用的 AI”这一目标。
BBVA 扩大与 OpenAI 的合作,启动多年期 AI 转型计划并向 120,000 名员工全面部署 ChatGPT Enterprise。双方将共同开发 AI 解决方案,以增强客户互动、简化运营流程并构建原生 AI 银行体验。
llama.cpp server 推出 router 模式,允许在不重启服务的情况下动态加载、卸载和切换多个模型。该功能采用多进程架构,每个模型独立运行,单个模型崩溃不影响其他模型。用户可通过自动发现缓存或指定目录来管理 GGUF 文件,并支持按需加载、LRU 驱逐及请求路由,同时提供 Web UI 进行模型切换。
推荐理由:llama.cpp 新增 router 模式实现多模型动态加载与切换,无需重启服务即可管理本地 LLM。
OpenAI 发布 GPT-5.2,称其为迄今在数学和科学领域最强的模型。该模型在 GPQA Diamond 和 FrontierMath 等基准测试中创下新的 SOTA 结果。官方展示其能解决开放理论问题并生成可靠的数学证明,推动实际科研进展。
推荐理由:原文指出GPT-5.2在GPQA Diamond和FrontierMath等基准上刷新纪录,并展示了其在解决开放理论问题和生成可靠数学证明方面的实际科研进展。
Google DeepMind 宣布与英国 AI 安全研究所(AISI)签署新谅解备忘录,将合作从模型测试扩展至基础安全研究。双方将共享专有模型数据,重点开展思维链监控、社会情感影响评估及经济系统模拟等前沿课题。此举旨在通过联合报告与技术协作,提升 Gemini 3 等先进模型的安全性并推动行业进步。
Podium 基于 OpenAI 的 GPT-5 模型构建了名为“Jerry”的 AI 智能体,旨在为超过 10,000 家中小企业提供自动化客户服务支持。该方案通过引入 AI 队友显著提升了业务运营效率,并实现了 300% 的增长,彻底改变了传统街边小店(Main Street businesses)的服务模式。
OpenAI 发布文章回顾成立十年来的技术进展,从早期研究突破到广泛应用的 AI 系统。文中分享了过去十年的经验教训,并重申了对构建造福全人类的通用人工智能(AGI)的乐观态度。
OpenAI 发布 GPT-5.2 系统卡更新,确认其作为 GPT-5 系列最新模型族的安全缓解策略与 GPT-5 及 GPT-5.1 基本一致。该模型基于公开互联网、第三方合作及用户提供的多样化数据集进行训练。
Hugging Face 发布教程,指导用户通过 HF Skills 仓库配置 OpenAI Codex,使其能够自动完成大语言模型的微调、评估及发布全流程。该方案支持监督微调(SFT)、直接偏好优化(DPO)等生产级方法,Codex 可自动验证数据集格式、根据模型规模选择 GPU 硬件并提交任务至 Hugging Face Jobs。
推荐理由:展示了如何通过 HF Skills 让 Codex 自动执行从数据验证、硬件选择到模型发布的全流程,为开发者提供了可复用的自动化训练工作流参考。
OpenAI 正式发布 GPT-5.2 模型,定位为面向专业工作的新一代前沿模型。该版本在推理、编码和长上下文理解方面进行了优化,旨在提升复杂任务的处理效率与可靠性。
推荐理由:OpenAI 官方宣布推出 GPT-5.2,强调其在专业工作场景下的推理与编码能力升级。
OpenAI 宣布与迪士尼达成多年期战略合作。协议包含迪士尼向 OpenAI 授权其影视角色用于 AI 生成视频,以及将 Sora 和 ChatGPT 深度集成至迪士尼数字生态中。
Google Research 在 COLM 2025 发布 Urania 框架,利用差分隐私(DP)聚类与关键词提取从 LLM 对话中生成安全洞察。该方案通过数学化隐私预算 ε 确保单条对话不影响结果,相比 CLIO 等启发式方法提供更强的形式化隐私保证。
Google DeepMind 宣布深化与英国政府的合作,重点加速 AI 在科学发现、教育现代化及国家安全领域的落地。双方将提供 AlphaEvolve、AlphaGenome 等前沿模型优先访问权,并于 2026 年在英国建立首个全自动材料科学实验室。
OpenAI 正投资加强安全防护与防御能力,以应对 AI 模型在网络安全领域日益增强的功能。该公司通过评估风险、限制滥用以及与社区合作来强化网络韧性。
Scout24 基于 GPT-5 打造对话式助手,重构房地产搜索体验。该工具通过澄清问题、生成摘要及提供定制化房源推荐引导用户。
Mistral AI 推出新一代开源代码模型家族 Devstral 2(123B)和 Devstral Small 2(24B),并发布了原生命令行工具 Mistral Vibe CLI。
推荐理由:原文给出了两款开源代码模型的参数规模、SWE-bench 得分及配套的终端 CLI 工具,读者可据此评估其在本地部署和自动化编程中的实际效能。
Google DeepMind 与 Kaggle 合作发布 FACTS Benchmark Suite,包含参数化、搜索、多模态及 Grounding v2 四个基准,共提供 3,513 个公开示例。
OpenAI 通过官方新闻渠道发布了最新内容。具体细节需参考原文链接以获取完整信息。
OpenAI 发布首批认证课程及 AI Foundations 课程,旨在帮助用户构建实际 AI 技能并提升职业机会。这些课程聚焦于为未来工作做准备,提供从基础到实战的技能培养路径。
OpenAI 与 Deutsche Telekom 达成合作,旨在为欧洲数百万用户提供先进的多语言 AI 体验。双方还将部署 ChatGPT Enterprise,帮助 Deutsche Telekom 员工优化工作流程并加速创新。
OpenAI 宣布任命 Denise Dresser 为首席营收官,负责统筹企业级及客户成功领域的全球营收战略。她将协助更多企业在日常运营中应用 AI,以支持 OpenAI 的持续规模化发展。
澳大利亚联邦银行(Commonwealth Bank of Australia)与 OpenAI 达成合作,向 50,000 名员工全面部署 ChatGPT Enterprise。此举旨在规模化构建 AI 素养,以优化客户服务体验并提升欺诈响应能力。
OpenAI 与 Instacart 深化合作,在 ChatGPT 中推出首个完全集成的杂货购物及 Instant Checkout 支付应用。该功能将购物流程直接嵌入对话界面,使用户能在 ChatGPT 内完成从选购到结算的全链路操作。
OpenAI 基于企业数据发布《The state of enterprise AI》报告,指出2025年各行业AI采用加速、集成加深并带来可衡量的生产力提升。该发现源自OpenAI内部企业数据分析,反映了当前企业级AI应用的整体趋势与成效。
Virgin Atlantic CFO Oliver Byers 分享该航空公司利用 AI 加速开发、优化决策并提升客户体验。
Hugging Face 推出 swift-huggingface,为 Swift 开发者提供完整的 Hugging Face Hub 客户端。该工具支持断点续传、与 Python 生态共享缓存及 OAuth 认证,旨在解决模型下载慢和鉴权混乱问题。它将集成至 swift-transformers 以替代现有实现,并即将支持 Xet 存储后端加速下载。
Google Research 推出 Titans 架构及 MIRAS 理论框架,结合 RNN 速度与 Transformer 精度实现测试时记忆。Titans 利用“惊讶度”指标动态更新参数,通过动量机制和自适应权重衰减管理长序列信息。MIRAS 将序列建模统一为关联内存模块,突破均方误差范式限制,支持实时适应无需离线重训练。
OpenAI 正式推出 OpenAI for Australia,旨在构建主权 AI 基础设施并加速澳大利亚 AI 生态系统创新。该计划将重点提升超过 150 万名工人的技能水平,以支持国家层面的技术发展与产业升级。
密歇根州立大学团队利用 AlphaFold 预测光合作用关键酶 GLYK 的三维结构,发现高温下其柔性环易失稳。研究人员借鉴嗜热藻类特征构建混合酶,成功使该酶在 65 °C 高温下保持稳定,为培育耐热作物提供新路径。
Hugging Face 推出 `hf-llm-trainer` 技能,使 Claude Code、Codex 和 Gemini CLI 等编码智能体能通过自然语言指令自动执行大语言模型的微调任务。
推荐理由:原文展示了通过自然语言指令让编码智能体完成从硬件选择到模型部署的全流程微调,提供了可复用的技能包配置与成本估算方法。
Intel AI Software Group 推出 DeepMath,这是一个基于 Qwen3-4B Thinking 并通过 GRPO 微调的轻量级数学推理智能体。该模型利用 smolagents 库生成简短 Python 代码片段并在沙箱中执行,将输出长度减少高达 66% 的同时提升准确率。
Google Research 在 NeurIPS 2025 上推出 Massive Sound Embedding Benchmark (MSEB),旨在标准化评估多模态模型的八项核心听觉能力。该基准包含新开源的 SVQ 数据集,涵盖 177,352 条跨 26 个地区、17 种语言的语音查询。实验显示当前声音表示远非通用,在所有任务中存在显著性能提升空间。
OpenAI 研究人员正在测试一种名为“confessions”的方法,旨在训练模型在犯错或行为不当时主动承认。该机制有助于提升 AI 的诚实度、透明度及用户对模型输出的信任感。
OpenAI 宣布收购 Neptune,旨在深化对模型行为的可见性。此次收购将强化研究人员用于追踪实验和监控训练的工具能力。
OpenAI 基金会宣布 People-First AI Fund 首批受助者,向 208 个非营利组织发放 4050 万美元无限制赠款。这些资金旨在支持社区创新与机会。
Mistral AI 正式推出下一代模型家族 Mistral 3,包括 Mistral Large 3(41B 激活/675B 总参数的稀疏 MoE)以及 Ministral 3 系列(3B、8B、14B 密集模型)。
推荐理由:官方发布了包含稀疏 MoE 大模型和密集小模型的 Mistral 3 系列,全部采用 Apache 2.0 协议开源并支持多模态与推理能力。
Mirakl 利用 AI 智能体和 ChatGPT Enterprise 重新定义商务,实现了更快的文档处理与更智能的客户支持。该公司正通过构建 Mirakl Nexus 平台,向原生智能体商务(agent-native commerce)迈进。