跳到正文

全部动态

今日 42 条
6月17日周三
  1. Hugging Face Blog86

    智谱发布 GLM-5.2:支持 1M 上下文的长程任务旗舰模型

    智谱(Z.ai)发布最新旗舰模型 GLM-5.2,主打长程任务处理能力并首次提供稳定的 1M-token 上下文窗口。该模型采用 IndexShare 架构降低计算成本,在 FrontierSWE、PostTrainBench 等长程编码基准中表现优于多数闭源模型,成为排名第一的开源模型。

    推荐理由:原文给出了1M上下文在长程编码任务中的实测表现与架构优化细节,读者可以据此判断其作为开源旗舰模型的实际工程落地能力。

  2. Google DeepMind48

    Google DeepMind 与英国政府合作开发基于 Gemini 的 AI 规划原型

    Google DeepMind 联合英国政府推出基于 Gemini 的 AI 规划原型,旨在将住房申请处理时间缩短 50%。该工具通过数据整合、政策识别及报告起草辅助规划官员,同时保留人工最终决策权并记录审计轨迹。计划于 2027 年向全英议会推广,以加速实现 2029 年新建 150 万套住房的目标。

6月16日周二
  1. Google DeepMind62

    Google DeepMind 发布 AI Control Roadmap 以保障 AI 智能体安全

    Google DeepMind 发布 AI Control Roadmap,提出针对内部 AI 智能体的纵深防御框架,旨在应对模型对齐不完美时的安全风险。该框架借鉴 MITRE ATT&CK 标准,将未受信任的智能体视为潜在内部威胁,通过实时行为监控和分级响应机制来检测与阻止异常操作。

    推荐理由:原文提出了将内部 AI 智能体视为潜在内部威胁的防御框架,并公开了基于百万条轨迹分析的监控实践细节。

6月15日周一
  1. Import AI43

    Sequent 成立专注对齐研究,ChinaHeritaQA 基准显示开源模型超越人类

    英国 AI 安全研究所与 Timaeus 研究人员联合成立非营利组织 Sequent,旨在通过理论证明提升超级智能对齐信心。该机构计划初期融资 $100–150M,重点探索可扩展监督等方向以应对递归自我改进风险。另一项 ChinaHeritaQA 多模态基准测试显示,Qwen-VL-8B-Instruct 在中国文化遗产问答中准确率达 81%,显著高于人类平均水平的 ~67%。

6月13日周六
6月12日周五
6月11日周四
  1. Hugging Face Blog61

    PyTorch Profiling 系列第二篇:从 nn.Linear 到融合 MLP 的内核解析

    Hugging Face 发布 PyTorch Profiling 教程第二部分,深入解析从 nn.Linear 到多层感知机(MLP)的性能剖析。文章展示了 bias 加法如何通过 epilogue 融入 GEMM 内核,以及 torch.compile 如何将 GeLU 和乘法操作融合为单个 Triton 内核以减少 HBM 往返。

    推荐理由:通过对比 eager、compile 和手写 kernel 的 profiler trace,揭示了 PyTorch 中算子融合与内存访问优化的具体机制及权衡。

  2. OpenAI News60

    OpenAI 宣布最新商业动态

    OpenAI 通过官方新闻渠道发布了一项新的商业动态。该消息由 OpenAI News 直接披露,反映了公司在业务层面的最新进展。

    推荐理由:官方渠道确认了 OpenAI 的最新商业动作,为观察其战略走向提供了直接依据。

  3. Google DeepMind80

    Google DeepMind 发布 DiffusionGemma:文本生成速度提升4倍的实验性开源模型

    Google DeepMind 推出基于扩散模型的实验性开源模型 DiffusionGemma,在专用 GPU 上实现最高 4 倍的文本生成加速。该模型采用 Apache 2.0 许可证,拥有 26B 总参数但仅激活 3.8B 参数,支持双向注意力以优化代码填充和非线性文本结构生成,目前主要面向追求低延迟的本地交互式应用场景。

    推荐理由:该实验性模型通过并行生成机制将本地推理速度提升4倍,为开发者探索低延迟交互工作流提供了新的技术路径。

6月10日周三
6月9日周二
  1. Google DeepMind82

    Google DeepMind 发布 Gemma 4 12B:统一无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,这是一款旨在笔记本电脑上运行的高性能多模态模型。它采用独特的无编码器统一架构,将视觉和音频输入直接融入 LLM 主干网络,支持原生音频输入。

    推荐理由:该模型采用无编码器统一架构,在16GB显存设备上实现接近26B MoE的多模态推理能力,适合关注本地部署效率的开发者。

  2. Hugging Face Blog75

    智能体通过串联两个 Hugging Face Spaces 构建 3D 巴黎画廊的实践

    作者演示了编码智能体如何通过读取 Gradio Space 暴露的 `agents.md` 文件,自动调用 `ideogram-ai/ideogram4` 生成图像并串联 `VAST-AI/TripoSplat` 进行 3D Gaussian splat 重建,最终部署为静态 Space。

    推荐理由:展示了利用 agents.md 让智能体自动串联图像生成与3D重建Space的完整流程,为构建多媒体应用提供了可复用的集成方法。

6月8日周一
  1. OpenAI News67

    OpenAI 向 SEC 秘密提交 S-1 草案

    OpenAI 确认已向美国证券交易委员会(SEC)秘密提交 S-1 注册声明草案。公司表示目前尚未决定采取进一步行动的时间表。

    推荐理由:OpenAI官方确认已向SEC秘密提交S-1草案,但尚未确定后续行动时间表,为了解其上市进程提供了权威信源。

  2. Google DeepMind68

    Google DeepMind 发布塞拉利昂 AI 辅助学习影响评估研究

    Google DeepMind 公布在塞拉利昂进行的预注册随机对照试验结果,使用 Gemini 驱动的 Guided Learning 工具使学生在八周内数学成绩提升 0.258 个标准差,相当于 1.2 至 1.7 年的常规学习进度。

    推荐理由:原文披露了塞拉利昂预注册试验数据,显示AI辅助教学显著提升数学成绩且学生主动寻求理解而非答案。

  3. OpenAI News33

    OpenAI 推出经济研究交换平台

    OpenAI 正式推出“经济研究交换”(Economic Research Exchange)平台,旨在深入研究人工智能对就业、生产力及整体经济的影响。目前该平台已开放申请,供研究人员提交并参与精选的研究项目。

6月5日周五
  1. Google Research60

    Gemini Enterprise Agent Platform 推出基于 Agentic RAG 的跨语料检索功能

    Google Research 在 Gemini Enterprise Agent Platform 中推出了由 Agentic RAG 驱动的跨语料检索功能,旨在解决传统单步 RAG 在处理多源、多跳商业查询时的局限性。

    推荐理由:原文介绍了 Gemini Enterprise Agent Platform 中 Agentic RAG 的架构设计与实验数据,读者可了解其如何通过多智能体协作与充分上下文检查提升复杂查询的准确性。