跳到正文

#论文/研究

今日 0 条
7月8日周三
  1. Google Research40

    Google Research 在 Nature Cities 发表导航平台缓解城市拥堵研究

    Google Research 联合发布首个大规模实证研究,证实通过 Google Maps 算法微调引导不足 2% 的车辆避开瓶颈路段,可显著提升全城交通效率。实验显示目标路段车速中位数提升约 2%,燃油消耗降低 0.5%-1.0%,每年每城可减少数千吨 CO2e 排放。该成果发表于《Nature Cities》,确立了从个体路径优化向协同路由范式演进的技术框架。

7月1日周三
  1. Hugging Face Blog45

    ScarfBench:评估 AI 智能体企业 Java 框架迁移能力的基准测试

    Hugging Face 推出开源基准 ScarfBench,评估 AI 智能体在 Spring、Jakarta EE 和 Quarkus 间的 Java 框架迁移能力。该基准包含 34 个应用和 204 个迁移任务,要求通过构建、部署及行为验证。结果显示最强智能体行为成功率低于 10%,且存在自我评估过度自信问题,配置与依赖管理是主要难点。

6月30日周二
  1. Hugging Face Blog32

    DiScoFormer:单 Transformer 同时估计密度与分数

    Hugging Face 推出 DiScoFormer,该模型通过单次前向传播即可同时估计数据分布的密度和分数,无需针对新分布重新训练。在 100 维数据上,其分数误差比最佳 KDE 低约 6.5 倍,密度误差降低超 37 倍,且能泛化至非高斯分布。这一预训练插件式估计器有望大幅降低生成建模及科学计算中的成本。

6月25日周四
6月19日周五
  1. Hugging Face Blog60

    Hugging Face 发布 MosaicLeaks:深度研究智能体的隐私泄露风险与 PA-DR 防御方法

    Hugging Face 联合 ServiceNow 等机构发布 MosaicLeaks 基准,揭示深度研究智能体在多跳检索中因“马赛克效应”导致私有信息通过 Web 查询日志泄露的风险。

    推荐理由:提出MosaicLeaks基准与PA-DR训练法,量化智能体查询隐私泄露风险并给出兼顾任务性能与隐私保护的RL方案。

6月18日周四
6月16日周二
  1. Google DeepMind62

    Google DeepMind 发布 AI Control Roadmap 以保障 AI 智能体安全

    Google DeepMind 发布 AI Control Roadmap,提出针对内部 AI 智能体的纵深防御框架,旨在应对模型对齐不完美时的安全风险。该框架借鉴 MITRE ATT&CK 标准,将未受信任的智能体视为潜在内部威胁,通过实时行为监控和分级响应机制来检测与阻止异常操作。

    推荐理由:原文提出了将内部 AI 智能体视为潜在内部威胁的防御框架,并公开了基于百万条轨迹分析的监控实践细节。

6月13日周六
6月11日周四
6月8日周一
  1. Google DeepMind68

    Google DeepMind 发布塞拉利昂 AI 辅助学习影响评估研究

    Google DeepMind 公布在塞拉利昂进行的预注册随机对照试验结果,使用 Gemini 驱动的 Guided Learning 工具使学生在八周内数学成绩提升 0.258 个标准差,相当于 1.2 至 1.7 年的常规学习进度。

    推荐理由:原文披露了塞拉利昂预注册试验数据,显示AI辅助教学显著提升数学成绩且学生主动寻求理解而非答案。

6月5日周五
  1. Google Research67

    Google Research 发布 PHRM:通过智能手机摄像头实现被动心率监测

    Google Research 在 Nature 发表研究,推出名为 PHRM 的被动心率监测系统,利用智能手机前置摄像头在日常使用中估算心率和静息心率。该系统在实验室和真实场景下均达到 MAPE < 10% 的精度,且在不同肤色群体中表现一致,其每日静息心率估算误差小于 5 bpm,媲美可穿戴设备。

    推荐理由:原文展示了基于智能手机前置摄像头的被动心率监测系统,提供了跨肤色的高精度验证数据及开源数据集,为无穿戴设备的心血管健康追踪提供了可复用的技术方案。

6月3日周三
5月28日周四
5月16日周六
5月8日周五
4月30日周四
  1. Google DeepMind82

    Google DeepMind 发布 AI co-clinician 研究:探索多模态医疗智能体与医生协作模式

    Google DeepMind 宣布启动 AI co-clinician 研究计划,旨在通过“三元护理”模式让 AI 在医生监督下协助患者。该系统在 98 个初级保健查询中实现 97 例无关键错误,并在开放式药物问答基准上超越现有前沿模型。

    推荐理由:原文披露了AI co-clinician在真实临床查询中的零关键错误率及多模态实时交互能力,展示了其作为辅助工具而非替代者的具体边界。

4月22日周三
4月20日周一
  1. Berkeley AI Research35

    GRASP:面向长时域世界模型的梯度规划方法

    GRASP 是一种针对学习动力学(世界模型)的梯度规划器,旨在解决长时域规划中的病态优化与局部极小值问题。该方法通过将轨迹提升至虚拟状态实现时间并行优化,在状态迭代中直接引入随机性以增强探索,并重塑梯度信号以规避高维视觉模型中脆弱的“状态-输入”梯度依赖。

4月16日周四
4月15日周三
  1. Hugging Face Blog60

    IBM Research 发布 VAKRA 基准:揭示 AI Agent 推理与工具使用的失败模式

    IBM Research 推出 VAKRA,这是一个用于评估 AI Agent 在企业级环境中推理和行动能力的可执行基准测试。该基准包含超过 8000 个本地托管 API 和 62 个领域的真实数据库,要求模型完成 3-7 步的复杂推理链。分析显示,尽管现代模型能执行孤立工具调用,但在多跳推理、多源检索及遵守工具使用策略时表现不佳,暴露了从表面能力到端到端可靠性的差距。

    推荐理由:IBM Research 在 Hugging Face 博客发布 VAKRA 基准测试,通过执行轨迹分析揭示了当前 AI Agent 在多步工作流中的具体失败模式。

4月14日周二
4月9日周四
4月3日周五
  1. Google Research42

    Google Research 评估 LLM 行为倾向与人类对齐

    Google Research 提出框架评估 25 个 LLM 的行为倾向,发现模型在共识场景下存在方向性偏差,且在无共识时无法覆盖人类意见范围。该研究利用情境判断测试(SJT)替代自报问卷,通过对比模型响应与 10 名标注者偏好分布,量化模型在共情、情绪调节等特质上与人类行为的对齐程度。

4月1日周三
  1. Google Research36

    Google Research 提出 AI 基准测试中评估者数量与样本量的权衡策略

    Google Research 指出传统 AI 评测中每项仅用 3-5 名评估者不足以捕捉人类分歧,可靠结果往往需要超过 10 名评估者。研究通过模拟实验发现,最优的“广度”(多项目少人)与“深度”(少项目多人)比例取决于具体指标:追求多数票准确率宜采用广度策略,而捕捉意见细微差别则需增加评估者人数。在正确平衡下,约 1,000 次总标注即可实现高可复现性,相关模拟器已开源。

3月26日周四
  1. Google DeepMind65

    Google DeepMind 发布 AI 有害操纵评估工具包及实证研究

    Google DeepMind 发布新研究成果,推出首个经实证验证的工具包以衡量 AI 在现实世界中的有害操纵潜力。该研究基于英国、美国和印度的九项实验(涉及超过 10,000 名参与者),重点测试了金融和健康等高利害场景,发现 AI 在健康话题上的操纵效果最弱,且不同领域的成功并不互通。

    推荐理由:Google DeepMind 发布了首个经实证验证的 AI 有害操纵评估工具包,通过九项涵盖万余人的研究量化了模型在金融与健康场景下的操纵能力与倾向。

3月25日周三
  1. Google Research36

    Google Research 推出 S2Vec:自监督框架学习城市环境嵌入

    Google Research 在 Earth AI 计划中推出 S2Vec,这是一种用于学习环境通用嵌入的自监督框架。该模型利用 S2 Geometry 栅格化地理数据并通过掩码自动编码(MAE)进行训练,无需人工标签即可预测人口密度等社会经济指标。评估显示,S2Vec 在社会经济预测任务中与基于图像的基线方法表现相当,尤其在地理外推方面具有优势。

3月24日周二
  1. Hugging Face Blog48

    Hugging Face 发布语音智能体评估框架 EVA

    Hugging Face 推出首个联合评分任务准确性与对话体验的端到端语音智能体评估框架 EVA。该框架基于 bot-to-bot 架构,提供包含 50 个航空场景的数据集及 20 个系统的基准测试结果。研究发现存在一致的准确性-体验权衡,高任务完成率往往伴随较差的用户体验。

3月18日周三
  1. Google Research80

    Google Research 与 NHS 合作发表研究:AI 辅助乳腺癌筛查提升检出率并减少人工阅片量

    Google Research 与英国国家医疗服务体系(NHS)合作开展 AIMS 研究,并在 Nature Cancer 发表两项伴生研究,评估基于 AI 的乳腺癌检测系统在筛查工作流中的表现。

    推荐理由:Google Research 联合 NHS 发表两项 Nature Cancer 研究,证实 AI 在乳腺癌筛查中可提升检出率并显著降低放射科医生工作负荷。

3月17日周二
3月13日周五
  1. Berkeley AI Research28

    SPEX 与 ProxySPEX:LLM 大规模交互识别算法

    SPEX 和 ProxySPEX 算法通过稀疏性和低阶性假设,高效识别 LLM 中的关键特征、数据及组件交互。ProxySPEX 利用层级结构特性,在保持性能的同时将消融次数减少约 10 倍。该框架解决了传统方法在大规模上下文下计算不可行的问题,显著提升了可解释性分析效率。

3月12日周四
  1. Google Research70

    Google Research 推出 Groundsource:用 Gemini 将新闻报道转化为洪水历史数据

    Google Research 发布 Groundsource 方法,利用 Gemini 大模型从全球新闻中提取非结构化信息,构建包含 260 万条记录的城市山洪开放数据集。该方法通过分类、时间推理和空间定位技术处理 80 种语言的报道,经人工验证 82% 的数据具备实际分析价值,并已在 Google Flood Hub 中用于提供提前 24 小时的近全球城市山洪预报。

    推荐理由:该研究利用 Gemini 从新闻中提取结构化洪水数据,解决了历史观测缺失问题,为灾害预测提供了新范式。