跳到正文

#产品更新

今日 3 条
3月4日周三
2月27日周五
2月26日周四
2月19日周四
  1. Google DeepMind75

    Gemini 应用推出 Lyria 3 音乐生成功能

    Gemini 应用现已在 beta 阶段集成 Google DeepMind 最新的生成式音乐模型 Lyria 3,允许用户通过文本描述或上传图片视频生成 30 秒的高质量音轨。

    推荐理由:Gemini 应用集成 Lyria 3 模型,支持通过文本或图片生成带歌词的 30 秒音乐,并嵌入 SynthID 水印以增强 AI 内容可识别性。

2月13日周五
2月5日周四
1月30日周五
  1. Google DeepMind78

    Google DeepMind 向美国 AI Ultra 用户推出 Project Genie 交互世界原型

    Google DeepMind 即日起向美国 Google AI Ultra 订阅用户(18+)推出实验性研究原型 Project Genie。该应用由 Genie 3、Nano Banana Pro 和 Gemini 驱动,支持通过文本或图像提示创建、探索及混剪可交互的沉浸式世界,并能在移动时实时生成前方路径。

    推荐理由:官方开放了基于 Genie 3 的交互式世界原型,明确了实时生成路径与物理模拟的能力边界及当前限制。

1月28日周三
  1. Mistral AI68

    Mistral 发布 Vibe 2.0 终端编码智能体及 Devstral 2 模型更新

    Mistral AI 发布 Mistral Vibe 2.0,这是其终端原生编码智能体的重大升级,由 Devstral 2 模型家族驱动。新版本支持构建自定义子代理、执行前多选项澄清、通过斜杠命令加载技能以及统一代理模式,并包含自动更新功能。

    推荐理由:Mistral Vibe 2.0 引入自定义子代理和斜杠命令技能,配合 Devstral 2 模型升级,为终端原生编码提供了更灵活的工作流配置。

1月14日周三
  1. Google DeepMind68

    Google DeepMind 发布 Veo 3.1 Ingredients to Video 更新:增强一致性并支持原生竖屏

    Google DeepMind 发布 Veo 3.1 Ingredients to Video 功能更新,提升了基于参考图像生成视频的创意表现与角色一致性。此次更新首次支持原生 9:16 竖屏视频生成,并引入至 1080p 和 4K 分辨率的尖端升频技术。

    推荐理由:原文详述了 Veo 3.1 在角色一致性、原生竖屏输出及高分辨率升级方面的具体改进,为移动端创作和专业工作流提供了新的能力参考。

12月24日周三
12月16日周二
  1. Google Research65

    Google Research 推出 Gemini 驱动的 Paper Assistant Tool 为 STOC 2026 提供自动反馈

    Google Research 推出名为 Paper Assistant Tool (PAT) 的实验性工具,利用 Gemini 2.5 Deep Think 为 STOC 2026 的理论计算机科学论文提供提交前的自动反馈。

    推荐理由:原文披露了基于 Gemini 2.5 Deep Think 的 Paper Assistant Tool 在 STOC 2026 的实验数据,展示了 AI 辅助理论计算机科学论文预审核的实际效果与用户反馈。

11月25日周二
11月22日周六
11月21日周五
  1. Hugging Face Blog45

    Hugging Face TRL 集成 RapidFire AI,微调实验速度提升约 20 倍

    Hugging Face TRL 正式集成 RapidFire AI,通过自适应分块并发训练将微调实验吞吐量提升约 16–24 倍。用户可使用 RFSFTConfig 等零代码替换配置,在单 GPU 上并发比较多个 LLM 微调方案。该工具提供实时仪表盘与交互式控制操作,支持动态停止、克隆及修改运行中的任务以优化资源利用。

11月20日周四
  1. Google DeepMind63

    Google DeepMind 在 Gemini 应用中推出 AI 图像验证功能

    Google DeepMind 宣布在 Gemini 应用中引入 AI 图像验证功能,用户可通过上传图像询问是否由 Google AI 生成或编辑。该功能基于 SynthID 数字水印技术,结合模型推理提供内容背景信息。未来计划将验证范围扩展至视频和音频格式,并整合到搜索等更多平台中。

    推荐理由:官方介绍了在 Gemini 应用中集成 SynthID 水印检测的具体交互方式,为内容真实性验证提供了新的入口。

  2. Hugging Face Blog65

    Hugging Face 发布 AnyLanguageModel:为 Apple 平台提供本地与远程 LLM 的统一 API

    Hugging Face 推出 Swift 包 AnyLanguageModel,作为 Apple Foundation Models 框架的即插即用替代方案,支持在单一 API 下无缝切换本地(MLX、Core ML、llama.cpp)和云端(OpenAI、Anthropic 等)大模型。

    推荐理由:该工具通过统一 API 简化了 Apple 平台本地与云端大模型的集成,降低了开发者尝试开源模型的技术门槛。

11月19日周三
  1. Google Research82

    Google 推出 Generative UI:在 Gemini 和搜索中实现动态交互式界面

    Google Research 正式介绍 Generative UI(生成式用户界面)能力,该功能利用 AI 模型根据提示词动态生成网页、游戏或工具等完整交互体验,而非仅渲染静态内容。

    推荐理由:官方展示了基于 Gemini 3 的生成式 UI 技术,通过动态创建交互式界面替代静态文本输出,并已在搜索和助手应用中开启实验。

11月12日周三
10月28日周二
10月27日周一
  1. Hugging Face Blog73

    Hugging Face 发布 huggingface_hub v1.0:五年里程碑与核心功能更新

    Hugging Face 正式发布 huggingface_hub v1.0,标志着该库经过五年发展达到成熟阶段。此次更新引入了破坏性变更以支持未来十年,包括后端迁移至 httpx、全面采用 hf_xet 进行文件传输以及重新设计的 hf CLI。v1.0 版本在保持向后兼容的同时,通过移除遗留模式提升了性能,并集成了 MCP 和 tiny-agents 以简化 AI 智能体开发。

    推荐理由:原文详述了底层架构迁移与 CLI 重构,读者可据此评估升级对现有工作流的影响及新特性价值。

  2. Hugging Face Blog62

    Hugging Face 发布 datasets 库流式加载重大更新,效率提升百倍

    Hugging Face 对 `datasets` 库的流式加载功能进行了底层重构,实现了启动请求减少 100 倍、数据解析速度提升 10 倍以及样本吞吐量翻倍。

    推荐理由:Hugging Face 优化了 datasets 库的流式加载后端,通过减少请求风暴和引入预取机制,使大规模训练无需下载即可达到接近本地 SSD 的速度。

10月24日周五
  1. Hugging Face Blog68

    LeRobot v0.4.0 发布:增强开源机器人学习能力

    Hugging Face 发布 LeRobot v0.4.0,旨在提升开源机器人学习的性能与可扩展性。该版本引入了支持大规模数据的 Datasets v3.0、新的数据集编辑工具以及用于简化硬件集成的插件系统。

    推荐理由:LeRobot v0.4.0 通过引入 Datasets v3.0、新 VLA 模型及硬件插件系统,显著提升了开源机器人学习的扩展性与易用性。

10月23日周四
  1. Hugging Face Blog83

    Meta与Hugging Face联合发布OpenEnv Hub及0.1规范

    Meta和Hugging Face宣布合作推出OpenEnv Hub,这是一个用于构建、共享和探索智能体环境的开放社区中心。该Hub旨在解决大语言模型缺乏安全工具访问的问题,通过定义包含工具、API和执行上下文的沙盒环境,支持强化学习训练与部署。

    推荐理由:Meta与Hugging Face联合推出OpenEnv Hub,为智能体提供标准化的训练与部署环境,开发者可据此构建兼容的RL基础设施。

10月21日周二
  1. Hugging Face Blog65

    Hugging Face AI Sheets发布重大更新,新增图像视觉处理能力

    Hugging Face开源工具AI Sheets发布重大更新,正式加入对图像视觉内容的支持。用户现在可以在电子表格中直接上传、分析、提取信息以及生成和编辑图片,无需编写代码。

    推荐理由:AI Sheets新增视觉能力支持图像提取与生成,用户可在电子表格中直接处理多模态数据并导出结构化结果。

10月7日周二
  1. Hugging Face Blog68

    BigCodeArena发布:支持实时执行的代码生成模型评估平台

    BigCode项目推出BigCodeArena,这是首个允许用户通过实际运行代码来评估和比较AI代码生成模型的众包平台。该平台支持Python、JavaScript等10种语言及React、PyGame等8种执行环境,用户可提交任务并投票选择表现更好的模型。

    推荐理由:BigCodeArena通过引入实时执行反馈解决了代码生成评估中静态对比的局限,其数据揭示了不同模型在特定运行环境下的鲁棒性差异。

9月26日周五
  1. Hugging Face Blog58

    Hugging Face 发布 swift-transformers v1.0,聚焦端侧 LLM 与智能体支持

    Hugging Face 正式发布 swift-transformers v1.0,标志着该 Swift 库在 Apple Silicon 平台本地模型集成上的稳定性成熟。新版本将 Tokenizers 和 Hub 升级为顶级独立模块,引入更快的 Jinja 模板引擎并移除冗余依赖以简化开发体验。官方表示未来将重点深化对 MLX 框架的支持以及 MCP 等智能体应用场景的探索。

9月22日周一
  1. Hugging Face Blog40

    SyGra:面向 LLM 与 SLM 的一站式数据构建框架

    Hugging Face 推出 SyGra,这是一款专为大语言模型(LLM)和小语言模型(SLM)设计的一站式低代码/无代码数据构建框架。SyGra 支持 vLLM、Hugging Face TGI、Triton 和 Ollama 等多种推理后端,可简化从 Q&A 生成到 DPO 对齐等复杂数据集的创建与转换流程。该框架旨在通过自动化数据处理减少工程负担,加速模型对齐并提升数据质量。

9月19日周五
9月18日周四
9月17日周三
9月16日周二
9月15日周一