跳到正文

全部动态

今日 42 条
1月20日周二
  1. Hugging Face Blog80

    Overworld 发布实时交互式视频扩散模型 Waypoint-1

    Overworld 推出实时交互式视频扩散模型 Waypoint-1,支持通过文本、鼠标和键盘进行零延迟控制。该模型基于帧因果整流流 Transformer 架构,在 10,000 小时游戏画面数据上从头开始训练,专注于交互体验而非简单的微调。

    推荐理由:原文详细说明了从预训练到推理优化的技术路径,并给出了在消费级硬件上实现零延迟交互的具体性能数据。

1月18日周日
1月16日周五
  1. OpenAI News60

    OpenAI 宣布在美国市场测试广告业务

    OpenAI 宣布计划在美国市场开始测试广告业务。此举标志着该公司在商业化路径上的重要转变,旨在通过广告收入支持其 AI 服务的持续运营与扩展。

    推荐理由:OpenAI官方宣布将在美国市场测试广告业务,这一商业化转向直接影响其模型服务的成本结构与用户交互体验。

1月15日周四
  1. OpenAI News45

    OpenAI 投资 Merge Labs

    OpenAI 宣布投资 Merge Labs,旨在支持新型脑机接口技术。该合作致力于连接生物智能与人工智能,以最大化人类的能力、自主权及体验。

  2. Hugging Face Blog78

    Hugging Face 推出开源推理标准 Open Responses

    Hugging Face 联合社区推出基于 Responses API 的开源推理标准 Open Responses,旨在替代 Chat Completion 格式以更好地支持智能体(Agent)工作流。

    推荐理由:原文详细说明了 Open Responses 如何扩展 Responses API 以支持智能体工作流,并提供了具体的迁移指南和代码示例。

1月14日周三
  1. Google Research37

    Google Research 验证 Android Auto 急刹车事件作为道路碰撞风险领先指标

    Google Research 证实通过 Android Auto 收集的急刹车事件(HBE)与道路碰撞率呈显著正相关,可作为交通安全评估的领先指标。分析显示 HBE 数据密度是碰撞报告的 18 倍,能填补稀疏历史数据的空白并实时识别高风险路段。该发现支持将连接车辆数据整合至 Google Maps Platform 的道路管理洞察中,以替代传统滞后的事故统计进行网络级安全评估。

  2. Google Research65

    Google 发布 MedGemma 1.5 4B 与 MedASR 开源医疗模型

    Google Research 发布 MedGemma 1.5 4B 模型和 MedASR 语音识别模型,并启动 Kaggle 黑客松。MedGemma 1.5 新增对 CT、MRI 和全切片病理图像等高维医学影像的解读能力,在内部基准测试中疾病分类准确率较上一代显著提升;MedASR 专为医疗听写微调,错误率远低于通用 Whisper large-v3 模型。

    推荐理由:原文给出了MedGemma 1.5对CT和MRI等高维医学影像的支持及具体基准提升,开发者可据此评估其在复杂医疗场景中的适配潜力。

  3. Google Research26

    Google 演示动态表面码量子纠错

    Google Quantum AI 在 Nature Physics 发表研究,实验演示了基于 Willow 处理器的动态表面码。该方案通过交替电路结构解决泄漏与硬件约束问题,其中六边形晶格代码在距离从 3 扩展到 5 时逻辑错误率改善 2.15 倍,模拟显示误差抑制因子提升 15%。

  4. Google DeepMind68

    Google DeepMind 发布 Veo 3.1 Ingredients to Video 更新:增强一致性并支持原生竖屏

    Google DeepMind 发布 Veo 3.1 Ingredients to Video 功能更新,提升了基于参考图像生成视频的创意表现与角色一致性。此次更新首次支持原生 9:16 竖屏视频生成,并引入至 1080p 和 4K 分辨率的尖端升频技术。

    推荐理由:原文详述了 Veo 3.1 在角色一致性、原生竖屏输出及高分辨率升级方面的具体改进,为移动端创作和专业工作流提供了新的能力参考。

1月13日周二
  1. Google Research52

    Google Research 发布 NeuralGCM 降水模拟新进展

    Google Research 在 Science Advances 发表新论文,介绍其混合大气模型 NeuralGCM 如何通过直接基于卫星降水观测数据进行训练,从而改进长期全球降水模拟。该模型在 280 km 分辨率下,相比传统物理模型,在平均降水、极端降水(特别是前 0.1% 降雨量)及日循环再现方面均取得显著提升,误差降低约 40%。

1月10日周六
1月9日周五
1月8日周四
1月7日周三
  1. OpenAI News62

    OpenAI 推出 ChatGPT Health 专用健康体验

    OpenAI 发布 ChatGPT Health,这是一个专用的健康体验功能。该功能可安全连接用户的健康数据和应用,并具备隐私保护及由医生参与的设计特点。

    推荐理由:OpenAI 推出 ChatGPT Health,通过安全连接健康数据与应用并采用医生参与设计,为个人健康管理提供专用体验。

1月6日周二
1月5日周一
1月2日周五
  1. OpenAI News15

    OpenAI 宣布启动 Grove Cohort 2

    OpenAI 启动 Grove Cohort 2,这是一个为期 5 周的创始人项目,面向从创意初期到产品阶段的个人。参与者将获得 $50K API credits、AI 工具早期访问权及 OpenAI 团队的实战指导。

12月24日周三
12月23日周二
12月22日周一
12月19日周五
12月18日周四
  1. OpenAI News28

    OpenAI 深化与美国能源部合作

    OpenAI 与美国能源部签署谅解备忘录,旨在深化在 AI 和先进计算领域的合作以支持科学发现。该协议建立在双方与国家实验室持续合作的基础上,并为在整个美国能源部生态系统中将 AI 应用于高影响力研究建立了框架。

  2. OpenAI News78

    OpenAI 发布 GPT-5.2-Codex 编程模型

    OpenAI 推出其最先进的编程模型 GPT-5.2-Codex。该模型支持长程推理和大规模代码转换,并增强了网络安全相关能力。

    推荐理由:官方明确该模型具备长程推理、大规模代码转换及增强的网络安全能力,为开发者评估其在复杂工程任务中的表现提供了核心依据。

12月17日周三
  1. Mistral AI60

    Mistral AI 发布 Mistral OCR 3 模型

    Mistral AI 正式发布 Mistral OCR 3,该模型在表单、扫描文档、复杂表格和手写内容上的整体胜率比 Mistral OCR 2 高出 74%。

    推荐理由:Mistral OCR 3 在表单、手写和复杂表格识别上较前代有显著提升,且以极低价格提供 API 服务,适合需要高精度文档解析的开发者评估。