跳到正文

全部动态

今日 12 条
1月14日周三
  1. Google Research65

    Google 发布 MedGemma 1.5 4B 与 MedASR 开源医疗模型

    Google Research 发布 MedGemma 1.5 4B 模型和 MedASR 语音识别模型,并启动 Kaggle 黑客松。MedGemma 1.5 新增对 CT、MRI 和全切片病理图像等高维医学影像的解读能力,在内部基准测试中疾病分类准确率较上一代显著提升;MedASR 专为医疗听写微调,错误率远低于通用 Whisper large-v3 模型。

    推荐理由:原文给出了MedGemma 1.5对CT和MRI等高维医学影像的支持及具体基准提升,开发者可据此评估其在复杂医疗场景中的适配潜力。

  2. Google Research26

    Google 演示动态表面码量子纠错

    Google Quantum AI 在 Nature Physics 发表研究,实验演示了基于 Willow 处理器的动态表面码。该方案通过交替电路结构解决泄漏与硬件约束问题,其中六边形晶格代码在距离从 3 扩展到 5 时逻辑错误率改善 2.15 倍,模拟显示误差抑制因子提升 15%。

  3. Google DeepMind68

    Google DeepMind 发布 Veo 3.1 Ingredients to Video 更新:增强一致性并支持原生竖屏

    Google DeepMind 发布 Veo 3.1 Ingredients to Video 功能更新,提升了基于参考图像生成视频的创意表现与角色一致性。此次更新首次支持原生 9:16 竖屏视频生成,并引入至 1080p 和 4K 分辨率的尖端升频技术。

    推荐理由:原文详述了 Veo 3.1 在角色一致性、原生竖屏输出及高分辨率升级方面的具体改进,为移动端创作和专业工作流提供了新的能力参考。

1月13日周二
  1. Google Research52

    Google Research 发布 NeuralGCM 降水模拟新进展

    Google Research 在 Science Advances 发表新论文,介绍其混合大气模型 NeuralGCM 如何通过直接基于卫星降水观测数据进行训练,从而改进长期全球降水模拟。该模型在 280 km 分辨率下,相比传统物理模型,在平均降水、极端降水(特别是前 0.1% 降雨量)及日循环再现方面均取得显著提升,误差降低约 40%。

1月10日周六
1月9日周五
1月8日周四
1月7日周三
  1. OpenAI News62

    OpenAI 推出 ChatGPT Health 专用健康体验

    OpenAI 发布 ChatGPT Health,这是一个专用的健康体验功能。该功能可安全连接用户的健康数据和应用,并具备隐私保护及由医生参与的设计特点。

    推荐理由:OpenAI 推出 ChatGPT Health,通过安全连接健康数据与应用并采用医生参与设计,为个人健康管理提供专用体验。

1月6日周二
1月5日周一
1月2日周五
  1. OpenAI News15

    OpenAI 宣布启动 Grove Cohort 2

    OpenAI 启动 Grove Cohort 2,这是一个为期 5 周的创始人项目,面向从创意初期到产品阶段的个人。参与者将获得 $50K API credits、AI 工具早期访问权及 OpenAI 团队的实战指导。

12月24日周三
12月23日周二
12月22日周一
12月19日周五
12月18日周四
  1. OpenAI News28

    OpenAI 深化与美国能源部合作

    OpenAI 与美国能源部签署谅解备忘录,旨在深化在 AI 和先进计算领域的合作以支持科学发现。该协议建立在双方与国家实验室持续合作的基础上,并为在整个美国能源部生态系统中将 AI 应用于高影响力研究建立了框架。

  2. OpenAI News78

    OpenAI 发布 GPT-5.2-Codex 编程模型

    OpenAI 推出其最先进的编程模型 GPT-5.2-Codex。该模型支持长程推理和大规模代码转换,并增强了网络安全相关能力。

    推荐理由:官方明确该模型具备长程推理、大规模代码转换及增强的网络安全能力,为开发者评估其在复杂工程任务中的表现提供了核心依据。

12月17日周三
  1. Mistral AI60

    Mistral AI 发布 Mistral OCR 3 模型

    Mistral AI 正式发布 Mistral OCR 3,该模型在表单、扫描文档、复杂表格和手写内容上的整体胜率比 Mistral OCR 2 高出 74%。

    推荐理由:Mistral OCR 3 在表单、手写和复杂表格识别上较前代有显著提升,且以极低价格提供 API 服务,适合需要高精度文档解析的开发者评估。

  2. Google DeepMind86

    Google DeepMind 发布 Gemini 3 Flash:兼顾前沿智能与速度

    Google DeepMind 发布 Gemini 3 Flash,旨在以更低成本和更高速度提供接近 Pro 级别的前沿智能。该模型在 GPQA Diamond 得分 90.4%,SWE-bench Verified 得分 78%,比 Gemini 2.5 Pro 快 3 倍且平均少用 30% token。

    推荐理由:原文给出了 Gemini 3 Flash 在多项基准测试中的具体分数、定价及与上一代模型的性能对比,读者可据此评估其在速度与成本平衡上的实际竞争力。

  3. OpenAI News24

    OpenAI 推出面向新闻机构的 OpenAI Academy

    OpenAI 联合 American Journalism Project 和 The Lenfest Institute 推出 OpenAI Academy for News Organizations,旨在帮助新闻机构有效使用 AI。该学习中心提供培训、实际用例及负责任使用指南,支持记者、编辑和出版商在报道与运营中采用 AI。

  4. OpenAI News62

    OpenAI 发布新平台功能

    OpenAI 正式推出新的平台功能,允许开发者在 OpenAI 生态中构建和部署应用。该更新扩展了现有 API 的能力边界,为第三方集成提供了更丰富的工具支持。

    推荐理由:官方宣布新功能上线,开发者可据此评估在 OpenAI 生态中构建应用的新机会。

12月16日周二
  1. Google Research65

    Google Research 推出 Gemini 驱动的 Paper Assistant Tool 为 STOC 2026 提供自动反馈

    Google Research 推出名为 Paper Assistant Tool (PAT) 的实验性工具,利用 Gemini 2.5 Deep Think 为 STOC 2026 的理论计算机科学论文提供提交前的自动反馈。

    推荐理由:原文披露了基于 Gemini 2.5 Deep Think 的 Paper Assistant Tool 在 STOC 2026 的实验数据,展示了 AI 辅助理论计算机科学论文预审核的实际效果与用户反馈。

  2. Hugging Face Blog65

    IBM Research 发布 CUGA 智能体并上线 Hugging Face Spaces 演示

    IBM Research 宣布其开源通用智能体框架 CUGA (Configurable Generalist Agent) 正式集成至 Hugging Face Spaces,并提供在线演示。

    推荐理由:IBM Research 将 CUGA 智能体集成至 Hugging Face Spaces,提供基于 gpt-oss-120b 的可视化演示及 Langflow 低代码支持,便于开发者快速评估其在复杂任务中的表现。