Graphite 研究揭示 Claude Opus 5.5 与 OpenAI Astra 的 AI 写作特征
Graphite 研究发现 Claude Opus 5.5 高频使用“this matters”等短语,OpenAI Astra 则偏好“corrective framing”。尽管各模型已大幅减少破折号使用,但新出现的语言习惯表明 AI 写作痕迹依然显著且难以完全消除。
Graphite 研究发现 Claude Opus 5.5 高频使用“this matters”等短语,OpenAI Astra 则偏好“corrective framing”。尽管各模型已大幅减少破折号使用,但新出现的语言习惯表明 AI 写作痕迹依然显著且难以完全消除。
来自卡内基梅隆大学、MIT、纽约大学和斯坦福大学的研究团队开发了名为 Ataraxos 的 AI,在 Stratego 游戏中以 15 胜 1 负 4 平的成绩击败了公认的最强人类玩家 Pim Niemeijer。该模型仅使用 16 个 GPU 和数千美元的训练成本即实现了这一突破,解决了此前 DeepMind 等高预算机构未能攻克的难题。
新系统 Ataraxos 在 Stratego 游戏中击败了被认为是历史上最伟大玩家的 Jeroen Niemeijer,有效胜率达到 85%。该研究指出,Ataraxos 仅使用约 8000 美元的算力成本(16 块 Nvidia H100 GPU 运行一周加 4 块 GPU 四天),远低于此前 DeepMind 的 DeepNash 系统所需的数百万美元。
推荐理由:原文详细对比了 Ataraxos 与 DeepNash 在算力成本上的巨大差异,并展示了其在 Stratego 中击败人类顶尖选手的具体数据。
Microsoft Research 开发机器学习管线,为美国66,935个变电站提供提前30至60分钟的空间天气风险预警。该系统结合AE/Dst指数与地质数据,在2020-2026年评估期内检测出近80%的重大事件,其中≥10 nT/min主要事件检出率达76.5%,Dst模型在峰值时段优于Burton方程62.2%的小时数。
Google Research 推出 Diffusion Controller 框架,将扩散模型去噪过程重构为连续控制问题以统一引导与微调。该框架通过轻量级“转向阻尼器”网络动态调整生成轨迹,在保持基础模型画质稳定的同时精准对齐用户意图。实验显示其完全解锁版本对基线模型取得 90% 胜率,有效解决黑盒模型难以精细控制的痛点。
Hugging Face 推出 ProvenanceGuard,一种针对基于 MCP 的 LLM 智能体的源感知事实性验证层。该方案通过保留来源身份解决跨源混淆问题,在医疗场景测试中成功拦截 139 个错误声明中的 138 个,并在可识别来源时以约 86% 的准确率匹配正确出处。
Google Research 推出名为“AI video co-director”的统一多智能体框架,旨在解决现有扩散模型在生成长篇叙事视频时面临的语义漂移和级联失败挑战。
推荐理由:Google Research 提出基于 Gemini 和 Veo 的多智能体框架,通过全局优化和世界状态跟踪解决长视频生成的语义漂移问题。
Microsoft Research 挑战机器人仅依赖板载 GPU 进行推理的传统假设,提出将计算卸载至边缘或云端。实测显示该方案能提升任务成功率并延长电池寿命,同时支持更大模型运行。团队还推出了基于 Kubernetes 的工具链,帮助开发者在机器人、边缘和云之间部署分布式推理工作负载。
Microsoft Research 在 Nature 发表并开源 RetroChimera,该模型通过集成 R-SMILES 2 和 NeuralLoc 两个互补子模型及学习排序策略,显著提升了小分子逆合成路线的预测质量。盲测显示,PhD 级化学家更偏好其生成的反应预测,优于先前模型及文献记录。
Google Research 推出 MilleMiglia,这是一个用 C++ 编写的中间里程物流实例生成器,旨在解决该领域缺乏高质量公开数据的问题。它通过模拟真实的网络拓扑和需求分布,生成保护隐私的基准测试数据,以支持后续优化研究。源代码和文档已在 GitHub 开源。
Google Research 推出 Retrieve-for-Train 框架,通过离线强化学习将查询分解行为编译为监督信号,以解决 LLM 在复杂搜索中的推理瓶颈。该方案利用 RL 训练 Gemma3-4B 和 Qwen3-4B 生成对齐属性的子查询,并蒸馏至一个 53.9M 参数的扩散检索器中。此架构实现了单次非自回归推理,消除了测试时思维链开销,显著提升了集合级搜索结果的多样性与响应速度。
IBM Research 在 Hugging Face 博客发布新研究,指出传统 Mean@k 指标掩盖了智能体的不一致性问题,并引入 Pass^k 指标量化这一“一致性缺口”。
推荐理由:提出 Pass^k 指标揭示智能体一致性缺口,提供无需重跑的诊断工具与指南生成方法,可提升生产环境可靠性。
Google Research 提出 ToolGrad,利用“答案优先”策略和文本梯度迭代构建复杂工具链数据。该方法在 Berkeley Function Calling Leaderboard 上表现优异,微调后的 ToolGrad-12B 得分 83.1,超越 Gemini 2.5 Pro、Claude 4.5 Opus 及 GPT-5 等专有模型。
Google Research 评估了利用 UK Biobank 欧洲数据向 Biobank Japan 进行多基因风险评分(PRS)的迁移效果。研究发现,当目标样本量超过 15k 时,混合外部数据反而限制精度提升;高遗传相关性性状可受益于更大规模欧洲数据,而血脂等特异性状则不然。
Google Research 与 HHMI Janelia 等机构合作,在《Cell》发表迄今最大的雄性果蝇大脑及中枢神经系统完整连接组图谱。该图谱包含超过 16.6 万个神经元和 1.25 亿个突触连接,通过 Neuroglancer 工具提供可视化与下载。这一成果利用 AI 技术加速了从电子显微镜图像到 3D 神经重建的过程,为研究动物感知、刺激反应及神经修复提供了基础资源。
Hugging Face 发布 BenchMIRT,利用多维项目反应理论(MIRT)在单个提示词层面审计 LLM 基准。该方法基于 100 个模型、16 个基准及超 3.4 万个问题的数据训练,独立识别出安全与通用推理两个主导维度。分析显示 BBQ 和 WMDP 等基准的得分更多反映通用推理能力而非预设的安全目标,揭示了单一分数掩盖的多重信号。
Google Research 推出基于 Swin-S Transformer 的 MAPL-EMIT 框架,利用 EMIT 卫星数据自动检测全球甲烷羽流。该模型在专家标注数据上实现 84% 的高召回率,能同时完成增强量化、羽流分割和源定位。相关模型、合成数据及推理库已开源至 Kaggle 和 GitHub。
Google Research 推出 GlucoFM,一种采用双流设计分离血糖趋势与短期偏差的自监督基础模型。在四项队列的七项临床预测任务中,其 PR-AUC 平均比最佳 GluFormer 变体高 5.8 个百分点,并在餐后血糖反应预测中实现最低 MAE。该模型基于 109,066 小时无标签 CGM 数据预训练,展现出强大的跨数据集迁移及少样本适应能力。
Google Research 在 CHI 2026 发表研究原型 AgentHands,利用 LLM 推理与 XR 空间感知,使 AI 智能体能生成与语音同步的具身手势。该系统通过环境注册、手势库及实时解析,将抽象指令转化为直观物理演示,显著提升用户在兰花护理等场景中的空间理解能力。
Hugging Face 推出 Quantization-Aware Healing (QAH) 方法,使压缩至 60B 参数并量化为 MXFP4 的 GPT-OSS 120B 模型在 9 项基准测试中的 7 项上超越其 bfloat16 全精度版本。该方法通过直接从原始未压缩模型进行知识蒸馏,解决了结构压缩后传统恢复手段的性能瓶颈,实现了更小、更便宜且更准确的部署效果。
METR研究显示AI显著加速网络安全漏洞发现,数学领域贡献有限,而AI算法优化暂无可测加速。多校联合推出SPADE框架,利用Qwen3-30B模型通过自博弈合成训练环境,在AIME等基准测试中较基线提升8.1分。
Google Research 推出 Biomarker Discovery Framework,这是一个在人类监督下运行的多智能体系统,用于从可穿戴传感器数据中优先筛选候选生物标志物。该系统结合假设生成、统计分析与对抗验证,在三个队列(N=9,279)中识别出41个心理健康和25个代谢疾病候选数字生物标志物,并恢复了已知临床信号。
Google Research 推出 Mobility-Embedded POIs (ME-POIs) 框架,将匿名化移动模式与文本描述融合以增强地点表示。该框架在预测访问意图、价格等级分类及繁忙程度估算上分别实现 81.9%、75.1% 和 24.7% 的相对性能提升。
Hugging Face 发布最新研究,提出三种测试方法以量化语音识别模型中的“基准优化”(benchmaxxing)现象。研究发现部分高分开源 ASR 模型会利用 VoxPopuli 和 LibriSpeech 等数据集特有的声学线索来复现参考转录错误、恢复被静音的数字或切换拼写变体,而非忠实转录音频内容。
推荐理由:原文通过三种探针量化了语音模型对公开基准的过拟合现象,揭示了高分背后的声学线索依赖,为评估真实泛化能力提供了新视角。
IBM Research 发布关于 ALTK-Evolve 智能体记忆机制的研究,指出向上下文注入自蒸馏指南的效果取决于模型能力层级,需进行剂量校准而非简单累积。
推荐理由:原文通过八模型对比实验,揭示了智能体记忆注入剂量需随模型能力校准,为低成本提升任务完成率提供了具体策略。
DiG-bench 显示 Opus 5 和 Fable 5 在 Tier 7 任务中表现最佳,但当前前沿模型仍难超越人类。Paradigm Research 推出 RSI Simulator 以模拟递归自我改进过程。Inherent 发布开源权重模型 Faraday,旨在通过监督前沿模型展现科研品味。
Google Research 发布 PhotoScan,一种基于深度学习的框架,可直接从标准 2D 智能手机照片估算体脂率、A/G 比和 V/S 比。该模型在 UK Biobank 数据上预训练并在独立队列验证中表现出接近 DXA 扫描的精度,其体脂率预测平均绝对误差为 2.15,优于智能手表的生物电阻抗分析传感器。
Microsoft Research 推出 MindTopo 基准,评估多模态大模型在连续性、分离性、顺序、包围和结等拓扑概念上的理解能力。测试显示当前模型在静态图像识别上表现优于交互式规划任务,且整体性能远低于人类水平。这一发现表明模型难以在动作序列中维持一致的拓扑理解,为机器人及交互环境中的可靠决策提供了改进方向。
Google Research 引入“知识画像”行为框架和 WikiProfile 基准,区分大语言模型中的事实编码与检索能力。研究发现 Gemini-3-Pro 和 GPT-5 等前沿模型的事实编码率高达 95–98%,但仍有 26–34% 的已编码事实无法直接检索,表明事实性错误的瓶颈已从知识获取转向知识利用。
推荐理由:原文提出知识画像框架并构建 WikiProfile 基准,揭示前沿模型事实性错误主要源于检索失败而非编码缺失,为优化模型知识利用率提供新视角。
Microsoft Research 推出研究模型 CARE-X,这是一个用于胸部 X 光解读的统一视觉语言模型。该模型结合生成式与判别式能力,利用 DAPO 强化学习优化临床正确性,并支持确定性测量工具以处理依赖精确测量的病症。CARE-X 已在 Narayana Health 的真实世界印度临床数据上进行验证,旨在提供兼具自由文本推理与校准诊断预测的灵活输出。
IBM Research发布ALTK-Evolve方法,旨在解决LLM智能体从自身轨迹中学习时的高Token开销问题。与ACE系统每次注入完整Playbook不同,ALTK-Evolve采用按需检索策略,仅向模型提供其能处理的高支持度指南子集。
Hugging Face 推出离线 Top-K Logits 缓存与融合分块 KL 损失技术,解决大模型知识蒸馏的高显存痛点。该方法避免同时加载教师与学生模型及构建全词表矩阵,将单步训练峰值显存从约 250GB 降至 128GB。这一优化使长上下文修复可在单张 GPU 上运行,显著降低了大规模实验的成本门槛。
微软研究院推出开源框架 Orchard,其核心组件 Orchard Env 提供可复用的 Kubernetes 环境服务,支持跨任务域训练和评估智能体。
推荐理由:微软研究院开源了基于Kubernetes的Orchard框架,展示了小参数模型在软件工程等复杂任务中接近前沿系统的性能。
Google Research 发布论文提出 Chain-of-Evidence (CoE) 框架及 Science One Framework 原型,旨在解决 AI 自主科研中的可验证性问题。该框架通过构建原生证据链,实现了零幻影引用和完全可验证的评分,同时在 MLE-Bench 和 Parameter-Golf 等前沿基准测试中达到 SOTA 性能。
推荐理由:原文提出了基于证据链的可验证性框架,展示了在消除幻觉引用同时保持前沿基准性能的方法。
Berkeley AI Research 与 IBM Research 合作扩展了 K-Search 框架,新增 MLX 后端以自动将 CUDA 内核优化知识迁移至 Apple Silicon。
推荐理由:原文展示了通过结构化翻译层将 CUDA 内核知识迁移至 Apple Silicon 的方法,并给出了在 Attention 和 Mamba SSM 内核上的具体性能提升数据。
Berkeley AI Research 提出 ABBEL 框架,利用自然语言信念状态替代递归摘要以优化 LLM 长程交互。在 CollabBench 协作编码测试中,该方法将全上下文模型的性能差距缩小约 50%,训练步数减少 50%。ABBEL 通过监督信念内容重构观测信息,显著降低峰值上下文 token 长度并提升学习效率。
Google Research 发表关于 SymptomAI 的研究论文,介绍了一种用于日常症状评估的对话式 AI 智能体。在一项涉及 13,917 名参与者的随机全国性研究中,SymptomAI 生成的鉴别诊断(DDx)在超过 50% 的案例中被临床专家优先选择,且准确率高于其他临床医生提供的诊断。
推荐理由:原文展示了基于大规模真实用户对话的研究结果,提供了AI在症状评估中对比临床专家的表现数据及与可穿戴设备生物信号的关联分析。
Google Research 在 Nature 发表研究,利用强化学习框架让智能体从量子错误检测中持续调整数千个控制参数,解决计算与校准解耦瓶颈。该技术在 Willow 超导处理器上验证,使系统能在运行期间对抗漂移并稳定量子态,无需中断计算即可实时“调音”。
DharmaOCR 通过领域专用训练,在巴西葡萄牙语识别任务中表现优于 Mistral OCR4 和 Unlimited-OCR。该模型采用监督微调与直接偏好优化(DPO)两阶段训练,集中参数资源于目标语言,从而在提取质量和推理稳定性上取得优势。
Google Research 在 ICLR 2026 论文中揭示,扩散模型的“创造力”并非随机现象,而是神经网络训练中的“分数平滑”效应所致。该机制使去噪过程在训练数据点之间进行插值,从而生成新颖且合理的数据样本。