Cognition 利用 GPT-6 Astra 提升 Devin 自测能力
Cognition 使用 GPT-6 Astra 增强 Devin 的软件测试与验证能力。该模型旨在帮助工程师减少代码审查工作量并提高交付效率。
Cognition 使用 GPT-6 Astra 增强 Devin 的软件测试与验证能力。该模型旨在帮助工程师减少代码审查工作量并提高交付效率。
OpenAI 将 Habitat 从 Python 库演进为全球分布式存储平台,以支持超过 10 亿 ChatGPT 用户。该平台目前每秒处理 22M 请求,通过快速扩展在线存储能力满足大规模用户需求。
Google Research 提出 ToolGrad,利用“答案优先”策略和文本梯度迭代构建复杂工具链数据。该方法在 Berkeley Function Calling Leaderboard 上表现优异,微调后的 ToolGrad-12B 得分 83.1,超越 Gemini 2.5 Pro、Claude 4.5 Opus 及 GPT-5 等专有模型。
GitHub Copilot app 新增内置面板,支持在应用内直接完成代码变更审查、运行与预览。用户可通过 diff 面板查看增删改行,利用终端面板执行命令或脚本,并借助浏览器面板的 Pick & Polish 工具实时调整 UI 元素。这一集成工作流消除了编辑器、终端与浏览器间的切换,让用户能安全验证并合并 AI 生成的代码。
César de la Fuente 实验室利用 Codex 和 ChatGPT 在现存及已灭绝基因组中搜索抗药性感染的候选抗菌分子。该研究旨在通过 AI 工具加速发现对抗耐药菌的新型化合物,展示了大模型在生物医学探索中的具体应用价值。
OpenAI 宣布在 ChatGPT 中推出 Data Dashboard(数据仪表盘)功能,允许用户通过自然语言对话直接构建交互式数据视图。该功能旨在降低数据分析门槛,使用户无需编写代码即可从原始数据中生成可视化洞察。
Mistral 与 Cloudera 宣布合作,将模型集成至混合数据平台,支持在私有云、本地及全隔离环境中运行推理。企业可利用专有数据训练自定义模型并保留所有权,实现数据、智能与计算完全受控的主权 AI 部署。
OpenAI 与 GSA 宣布为符合条件的联邦、州、地方和部落政府提供免费许可证费用、50% 的使用折扣以及扩展的网络安全防御支持。该举措旨在扩大政府对 AI 技术的访问权限并强化其网络防御能力,降低公共部门采用先进 AI 工具的成本门槛。
OpenAI 发布 ChatGPT for Financial Services,集成内置金融数据与 GPT-6 Astra。该工具专为金融服务设计,支持研究、建模及生成客户就绪材料。
Hugging Face 博客介绍了在 HF Jobs 上使用 AsyncGRPOTrainer 进行 LoRA 微调的实践方案。该方案利用 Storage Bucket 挂载实现训练器与 vLLM 副本间的适配器同步,无需 NCCL 通信。
推荐理由:原文展示了利用存储桶同步LoRA适配器以解耦训练与推理的架构,并提供了通过指标分析将训练提速近4倍的具体调优路径。
Hugging Face 推出 Workflow1111,使用 Gradio Workflow 将 AUTOMATIC1111 的主要功能集重建为包含 73 个节点的单一工作流画布。
推荐理由:展示了用 Gradio Workflow 重构复杂图像生成工作流的路径,并说明了节点如何自动转化为 API 和 MCP 工具。
Paul Christiano 加入 OpenAI Foundation Board 及其安全与安保委员会。他将带来在 AI 对齐、安全和标准方面的经验。
OpenAI 指出当前 AI 政策窗口期开放,亟需采取行动。随着 AI 能力增强,必须同步强化安全证据、建立共享标准并推动持久的政策落地。
Mistral AI 协助一家欧洲能源运营商,利用 AI 智能体将 40,000 行 Fortran 77 物理模拟代码成功迁移至 C++。团队首先构建了基于数值一致性的校验框架(parity harness),并通过 Vibe CLI 生成调用树以自动化文档整理。
推荐理由:文章详细拆解了从构建数值校验框架到多智能体协作迁移Fortran代码的完整工程路径,为处理无测试遗留系统提供了可复用的结构化方法论。
MIT 研究人员利用 GPT-5.6 Sol 结合 Codex,自主执行量子计算实验、分析结果并校准量子比特。该应用展示了大模型在复杂科研流程中实现自动化操作的能力。
Google DeepMind 推出 AlphaGenome Atlas,这是一个包含人类基因组中90亿个单核苷酸变异分子效应预测的平台。该数据集规模达1 PB,并引入了结合 AlphaGenome 和 AlphaMissense 的 AVI 评分以辅助变异排序。目前该平台已通过网站门户、API 以及 Google Antigravity 技能向学术研究免费开放。
推荐理由:原文提供了覆盖全基因组90亿变异的预测地图及免费访问入口,读者可据此评估其在罕见病解析与群体遗传学研究中的实际可用性。
Mistral AI 宣布完成 30 亿欧元 D 轮融资,投后估值超过 210 亿欧元,创下欧洲科技公司最大股权融资纪录。本轮由三星电子领投,Scaleup Europe Fund 和 PSG Equity 联合领投。
推荐理由:原文披露了欧洲科技公司最大规模股权融资的具体金额与估值,并阐述了其主权AI全栈战略的商业落地细节。
OpenAI 分享了针对 Navier–Stokes 千禧年大奖难题的 AI 生成解决方案。该方案包含一份说明文档以及使用 Lean 编写的形式化证明。
1Password 工程师使用 Codex 快速构建新功能及内部工具,实现工程生产力提升 21%。该方案在确保代码达到生产就绪状态的同时,严格遵循了公司的安全策略。
OpenAI、AIRPPU 和 WAN-IFRA 共同启动一项 AI 计划,旨在协助乌克兰新闻机构。该计划重点帮助这些组织加强创新、提升韧性并维护独立新闻业。
OpenAI 研究员 Jakub Pachocki 反思日益强大的 AI 带来的对齐挑战,呼吁加强安全措施并推动国际协调。
OpenAI 内部编码智能体正在重塑 AI 研究,通过提升实验速度和任务复杂度实现研究加速。早期数据显示了智能体使用情况及对研究进度的具体影响。
GitHub 推出 Project HydraFusion 研究预览,这是一种通过运行时多模型编排来提供前沿智能的新功能。它能在本地、云端和复合模型间自动进行语义路由,开发者只需像选择普通模型一样选择 HydraFusion,系统会自动规划执行路径以平衡性能、成本和延迟。
推荐理由:GitHub 推出 HydraFusion 研究预览,通过多模型运行时编排实现前沿质量与成本平衡,提供实测数据与使用入口。
Google Research 评估了利用 UK Biobank 欧洲数据向 Biobank Japan 进行多基因风险评分(PRS)的迁移效果。研究发现,当目标样本量超过 15k 时,混合外部数据反而限制精度提升;高遗传相关性性状可受益于更大规模欧洲数据,而血脂等特异性状则不然。
Google Research 与 HHMI Janelia 等机构合作,在《Cell》发表迄今最大的雄性果蝇大脑及中枢神经系统完整连接组图谱。该图谱包含超过 16.6 万个神经元和 1.25 亿个突触连接,通过 Neuroglancer 工具提供可视化与下载。这一成果利用 AI 技术加速了从电子显微镜图像到 3D 神经重建的过程,为研究动物感知、刺激反应及神经修复提供了基础资源。
GitHub Copilot app 支持通过 Git worktrees 隔离并并行运行多个 AI 智能体会话,各任务独立执行且互不干扰。每个会话保留专属上下文,用户可随时切换查看进度或结果,无需等待前一个任务完成即可启动新任务,从而提升开发效率。
Google DeepMind 与 Google Research 联合发布 WeatherNext 3,这是其最新且最准确的全球天气 AI 模型。该模型直接利用实时静止卫星数据进行训练,每小时生成一次高分辨率预报,地表变量分辨率达 5 公里,较前代提升约五倍。
推荐理由:该模型通过直接学习实时卫星数据实现了小时级高分辨率预报,并集成至 Google 核心产品生态。
OpenAI 推出 Daybreak for Frontline Defenders,承诺投入 10 亿美元以扩大前沿网络 AI、培训和支持在关键服务领域的访问。该计划旨在通过提供先进工具与资源,增强对 essential services 的保护能力。
Hugging Face 推出 NeoMME 260M 和 800M 参数规模的多语言多模态编码器,采用单一双向 Transformer 处理文本与图像补丁。NeoMME-Retriever 在 ViDoRe v3 基准测试中表现优异,260M 版本吞吐量约为 ColModernVBERT 的两倍,并通过层级令牌池化和非对称量化将索引存储减少至每页 6 kB。
推荐理由:原文展示了单Transformer架构在视觉文档检索中的效率突破,提供了从模型权重到代码示例的完整开源实现。
Playco 利用 GPT-6 Astra 从单一灰盒基础构建了三款主题游戏原型。相比前代模型,该方案使手动修复数量减少了 50%。
Legora 利用 GPT-6 Astra 在几分钟内完成 41 份文档的审阅,并成功找出全部四个植入错误。该工作流使性能提升近 40%,展示了大模型在金融审查场景中的高效能力。
Hugging Face 发布教程,演示如何使用 TRL 库和 GRPO 算法微调 LFM2.5-350M 模型以改善结构化输出能力。该方案仅需约 500 个样本和 100 步训练,可在免费 Colab 或 Kaggle GPU 上运行,使模型在 IFStruct 基准测试中的得分从 22.6% 提升至 29.7%,显著缩小了与小参数模型和大模型之间的差距。
推荐理由:展示了在免费 GPU 上通过少量步骤微调小模型以提升结构化输出合规性的完整流程与实测效果。
Hugging Face 推出开源工具 funes,旨在为 Claude Code、Codex 等编码智能体提供本地持久化记忆层。它通过索引会话轨迹实现跨智能体和设备的上下文召回,支持私有数据集同步,并在基准测试中显示其成本低于传统上下文压缩或手动交接方案。
推荐理由:该工具通过本地索引和检索机制,将编码智能体的会话记录转化为可跨设备共享的记忆层,解决了上下文丢失问题。
作者基于 Hugging Face 平台完整复现了通过强化学习训练大语言模型编写 JavaScript 代码以生成水彩画的过程,并开源了所有训练脚本、环境和数据集。文章详细解析了结合 HPSv3 评分与 Qwen3-VL-30B-A3B-Instruct 视觉判断器的奖励机制设计,对比了三种不同权重配置的实验结果,展示了如何利用人工筛选的图像池引导模型学习特定审美风格。
推荐理由:完整公开了基于TRL和OpenEnv的强化学习训练代码、环境配置及三种奖励混合策略的实验对比,为复现美学偏好模型提供了可迁移的工程参考。
Google DeepMind 推出 Fairwind 计划,向政府、关键基础设施运营商及可信合作伙伴提供受限访问权限,以利用其先进的网络防御能力。该计划整合了 Gemini 3.8 Flash Cyber 模型与 CodeMender 框架,帮助防御者在安全的云环境中自主发现、验证并修复漏洞,将原本需数周的手动修补过程缩短至几分钟。
推荐理由:原文给出了面向政府与企业的受限访问计划,读者可以据此判断其如何利用专用模型实现漏洞的自主发现与修复。
Google DeepMind 推出 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber 两款新模型,前者主打智能体工作流与编码,后者专攻网络安全防御。
推荐理由:原文给出了两款新模型在长周期编码和网络安全领域的具体基准表现及定价,读者可据此评估其在自动化工作流中的实际效能与成本优势。
ATV Big Air Tour 利用 ChatGPT Work 加速营销与商品管理,将原本需 3 天的工作压缩至 3 小时。该团队甚至能在 15 分钟内将商品照片转化为库存网站。
Hugging Face 发布 BenchMIRT,利用多维项目反应理论(MIRT)在单个提示词层面审计 LLM 基准。该方法基于 100 个模型、16 个基准及超 3.4 万个问题的数据训练,独立识别出安全与通用推理两个主导维度。分析显示 BBQ 和 WMDP 等基准的得分更多反映通用推理能力而非预设的安全目标,揭示了单一分数掩盖的多重信号。
Google Research 推出基于 Swin-S Transformer 的 MAPL-EMIT 框架,利用 EMIT 卫星数据自动检测全球甲烷羽流。该模型在专家标注数据上实现 84% 的高召回率,能同时完成增强量化、羽流分割和源定位。相关模型、合成数据及推理库已开源至 Kaggle 和 GitHub。
Google DeepMind 宣布在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 模型中推出智能体视频理解功能。该功能通过让模型主动决定观看内容、速度和模态来替代固定帧率的静态处理,使 token 消耗最多降低 88%,成本最多减少 66%,准确率提升最高达 7%。
推荐理由:官方给出了视频理解从静态处理转向智能体动态检索的技术路径,并提供了具体的成本与精度优化数据。