跳到正文

全部动态

今日 11 条
3月4日周三
  1. Google DeepMind73

    Google DeepMind 发布 Gemini 3.1 Flash-Lite 模型

    Google DeepMind 推出 Gemini 3.1 Flash-Lite,这是其最快且最具成本效益的 Gemini 3 系列模型,现已通过 Gemini API 和 Vertex AI 向开发者和企业开放预览。

    推荐理由:官方公布 Gemini 3.1 Flash-Lite 的定价、速度提升及基准测试数据,为高并发场景下的模型选型提供具体参考。

2月28日周六
2月27日周五
  1. OpenAI News70

    OpenAI 宣布新一轮融资,估值达千亿美元级别

    OpenAI 宣布完成新一轮融资,投前估值达到千亿美元级别。本轮融资由 OpenAI 官方发布,具体金额与条款细节未在简短公告中完全展开。

    推荐理由:OpenAI 官方披露最新估值及主要投资方,为观察头部 AI 实验室资本结构与融资动态提供直接依据。

2月26日周四
2月25日周三
2月24日周二
2月23日周一
2月20日周五
  1. Hugging Face Blog68

    Hugging Face 发布使用 Unsloth 和 Jobs 免费微调 LFM2.5-1.2B-Instruct 的指南

    Hugging Face 联合 Unsloth 推出免费额度计划,指导用户通过 Claude Code 或 Codex 等编码智能体在 Hugging Face Jobs 上微调 LiquidAI/LFM2.5-1.2B-Instruct 模型。

    推荐理由:提供了结合 Unsloth 和 Hugging Face Jobs 进行低成本微调的具体命令与 Skill 安装方法,适合希望快速上手云端训练的开发者。

  2. Google DeepMind86

    Google DeepMind 发布 Gemini 3.1 Pro 模型

    Google DeepMind 正式发布 Gemini 3.1 Pro,作为 Gemini 3 系列的核心智能升级版本。该模型在 ARC-AGI-2 基准测试中取得 77.1% 的验证分数,推理性能较前代提升超过一倍。

    推荐理由:原文披露了 Gemini 3.1 Pro 在 ARC-AGI-2 基准上的具体得分及全平台开放入口,读者可据此评估其推理能力跃升幅度与当前可用性。

2月19日周四
  1. Hugging Face Blog78

    IBM与UC Berkeley利用IT-Bench和MAST诊断企业智能体失败原因

    IBM Research与UC Berkeley合作发布研究,引入多智能体系统失败分类法(MAST)分析IT-Bench基准测试中的执行轨迹,旨在解决传统基准仅报告成功率而无法解释失败原因的“黑盒”问题。

    推荐理由:IBM与UC Berkeley联合提出MAST框架,通过细粒度失败模式分类揭示企业级智能体在IT自动化任务中的具体故障原因及修复策略。

  2. Google DeepMind75

    Gemini 应用推出 Lyria 3 音乐生成功能

    Gemini 应用现已在 beta 阶段集成 Google DeepMind 最新的生成式音乐模型 Lyria 3,允许用户通过文本描述或上传图片视频生成 30 秒的高质量音轨。

    推荐理由:Gemini 应用集成 Lyria 3 模型,支持通过文本或图片生成带歌词的 30 秒音乐,并嵌入 SynthID 水印以增强 AI 内容可识别性。

2月18日周三
  1. Hugging Face Blog72

    Gradio 6 发布 gr.HTML 新功能支持单文件构建 Web 应用

    Gradio 6 更新了 gr.HTML 组件,支持自定义模板、作用域 CSS 和 JavaScript 交互,允许通过单个 Python 文件构建完整 Web 应用。该功能使 LLM 能一次性生成前端、后端及状态管理代码,无需构建步骤即可快速部署至 Hugging Face Spaces。

    推荐理由:原文展示了 gr.HTML 新特性如何支持单文件构建复杂交互组件,为 LLM 辅助开发提供了极简工作流参考。

  2. Google Research42

    Google Research 提出 MapTrace:利用合成数据提升多模态大模型地图路径追踪能力

    Google Research 推出 MapTrace,通过自动化流水线生成 200 万问答对以解决 MLLM 在地图路径追踪上的空间推理缺陷。该方案利用 Gemini 2.5 Pro 和 Imagen-4 构建含“Mask Critic”与“Path Critic”的合成数据管线,开源数据集旨在显式教授模型几何拓扑关系,弥补预训练模型缺乏物理世界导航规则的短板。

2月17日周二
2月13日周五
  1. OpenAI News62

    GPT-5.2 推导出理论物理学新结果

    OpenAI 宣布 GPT-5.2 在理论物理领域推导出一项新结果。一份新的预印本显示,GPT-5.2 提出了一个胶子振幅的新公式,该公式随后由 OpenAI 和学术合作者正式证明并验证。

    推荐理由:官方展示了 GPT-5.2 在理论物理领域提出新公式并被验证的案例,体现了大模型在前沿科学推理中的潜在能力。

  2. Hugging Face Blog77

    Hugging Face 发布用于编写生产级 CUDA 内核的智能体技能

    Hugging Face 推出一个智能体技能,指导 Claude 和 Codex 等编码代理编写生产级 CUDA 内核。该技能封装了 GPU 架构优化、PyTorch 绑定及库集成知识,已在 LTX-Video 和 Qwen3-8B 上验证,生成的 RMSNorm 内核在 H100 上实现约 1.9x 的隔离加速比。

    推荐理由:原文提供了可直接安装的 CUDA 内核编写技能及实测基准,展示了智能体在特定硬件优化任务中的落地能力。

  3. Google DeepMind82

    Google DeepMind 发布 Gemini 3 Deep Think 重大升级

    Google DeepMind 发布 Gemini 3 Deep Think 的重大升级,该专用推理模式旨在解决科学、研究和工程领域的现代挑战。新版本在 Humanity’s Last Exam(48.4%)、ARC-AGI-2(84.6%)和 Codeforces(Elo 3455)等基准测试中创下新高,并在国际物理和化学奥林匹克笔试部分达到金牌水平。

    推荐理由:官方公布了Deep Think在科学、工程和数学基准上的最新性能数据及API开放计划,为评估其解决复杂现实问题的能力提供了具体依据。

2月12日周四
  1. OpenAI News67

    OpenAI 发布 GPT-5.3-Codex-Spark 实时编码模型

    OpenAI 推出首个实时编码模型 GPT-5.3-Codex-Spark,生成速度提升 15 倍,支持 128k 上下文窗口。该模型目前以研究预览形式向 ChatGPT Pro 用户开放。

    推荐理由:官方发布了首款实时编码模型,提供了具体的速度提升倍数和上下文窗口参数,适合开发者评估其在编程场景下的响应效率。

2月11日周三
2月10日周二