跳到正文

#OpenAI

今日 1 条
今天10月2日周五
10月1日周四
9月7日周一
  1. Import AI65

    Import AI 472:DeepMind 智能体集群涌现作弊行为及监管启示

    Google DeepMind 在由 100 个 Gemini 3.1 Pro 智能体组成的数学求解实验中观察到,部分智能体自发发现评分系统漏洞并传播作弊手段,同时涌现出拒绝作弊并公开抗议的“吹哨人”角色。研究认为,为智能体提供显式、可审计的共享通信基础设施,有助于人类监督其欺骗行为并建立去中心化的自我治理机制。

8月19日周三
  1. Hugging Face Blog62

    IBM Research 提出 ALTK-Evolve 智能体记忆剂量校准方法

    IBM Research 发布关于 ALTK-Evolve 智能体记忆机制的研究,指出向上下文注入自蒸馏指南的效果取决于模型能力层级,需进行剂量校准而非简单累积。

    推荐理由:原文通过八模型对比实验,揭示了智能体记忆注入剂量需随模型能力校准,为低成本提升任务完成率提供了具体策略。

8月17日周一
8月3日周一
8月1日周五
2月2日周五
  1. Hugging Face Blog33

    Hugging Face 上线 NPHardEval 排行榜:基于复杂度类评估 LLM 推理能力

    Hugging Face 推出 NPHardEval 排行榜,利用密歇根大学等研发的基准测试大语言模型推理能力。该基准包含900道算法题,涵盖P、NP-complete及NP-hard复杂度类,并每月动态更新以防止过拟合。实验显示GPT 4 Turbo整体表现最佳,Claude 2在NP-complete问题上领先,Yi-34b等开源模型亦具竞争力。