跳到正文

#Agent

今日 4 条
今天10月2日周五
  1. AWS Machine Learning Blog58

    AWS 教程:基于 Amazon Bedrock AgentCore Runtime Instances 构建多智能体音乐制作流水线

    AWS 发布教程,指导开发者使用 Amazon Bedrock AgentCore Runtime Instances 构建包含作曲、交付和合规三个智能体的音乐制作流水线。该方案利用共享会话 ID 实现多智能体在同一 GPU 实例上的共置与文件系统共享,支持长达 14 天的持久化工作流及混合制品类型的独立部署。

  2. AWS Machine Learning Blog47

    基于 Amazon Bedrock AgentCore 构建环境感知智能体:从事件驱动信号到人在回路工作流

    Amazon Bedrock AgentCore 支持构建环境感知智能体,该模式通过监听 S3 或 EventBridge 等事件流自动触发任务,并利用 ask_human 工具实现人在回路交互。此方案结合 Lambda 与 DynamoDB 形成无服务器架构,解决了传统聊天式智能体无法并行处理基础设施事件的局限,提升了自动化流程的可靠性与扩展性。

10月1日周四
  1. Google DeepMind94

    Google DeepMind 发布 Gemini 4 Argon 模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,旨在提升复杂工作流中的深度推理能力,并已通过 Fairwind Program 向受信任的网络安全防御者推出。

    推荐理由:原文披露了 Gemini 4 Argon 在长上下文输出、软件工程基准及网络安全防御上的具体性能数据与分阶段开放策略,为评估前沿模型能力边界提供了直接依据。

9月30日周三
  1. AWS Machine Learning Blog59

    GPT-6.1 Sol 正式登陆 Amazon Bedrock

    OpenAI 的 GPT-6.1 Sol 模型现已在 Amazon Bedrock 上正式可用(GA)。该模型作为 GPT-6 Sol 的重大升级,在 agentic coding、计算机使用和复杂文档分析方面表现强劲,据 OpenAI 称其能以约五分之一的任务成本匹配 GPT-6 Astra 在 DeepSWE v1.1 上的性能。

  2. AWS Machine Learning Blog26

    Amazon Quick 各组件提示词工程模式与陷阱

    Amazon Quick 系列文章详解 Research、Flows 和 Sight 的提示词最佳实践。Quick Research 需明确目标受众并限定 S&P Global 等数据源;Quick Flows 应使用编号步骤定义触发条件与逻辑;Quick Sight 查询需包含业务问题、指标及维度以优化可视化结果。

9月29日周二
9月26日周六
  1. GitHub Blog · AI & ML63

    GitHub Copilot 应用入门:如何用 canvases 构建自定义工作流

    GitHub Copilot 应用推出 canvases 功能,允许用户通过 `/create-canvas` 技能用自然语言描述生成可定制的双向交互界面。该界面支持看板、清单等多种形态,用户与智能体可实时同步操作状态,无需编写代码即可创建并复用扩展工具。

    推荐理由:原文演示了如何通过自然语言描述生成双向交互界面,为构建个性化智能体工作流提供了具体方法。

9月25日周五
  1. GitHub Blog · AI & ML68

    GitHub Copilot 提出用 canvas 替代聊天作为主要交互界面

    GitHub Copilot 推出 canvas 功能,允许用户在应用内创建全栈自定义界面以替代传统聊天窗口进行交互。canvas 支持双向通信和本地代码执行,可用于构建如 Connect 4 游戏、Winget 包管理器等工具,从而减少不必要的 token 消耗并提升开发工作流的自动化程度。

    推荐理由:文章通过具体案例展示了如何利用 canvas 构建自定义交互界面,帮助开发者优化与 AI 智能体的协作流程。

  2. Google Research60

    Google Research 发布 AI 视频联合导演框架以自动化连贯长视频生成

    Google Research 推出名为“AI video co-director”的统一多智能体框架,旨在解决现有扩散模型在生成长篇叙事视频时面临的语义漂移和级联失败挑战。

    推荐理由:Google Research 提出基于 Gemini 和 Veo 的多智能体框架,通过全局优化和世界状态跟踪解决长视频生成的语义漂移问题。

  3. GitHub Blog · AI & ML78

    GitHub Security Lab 发布 AI 驱动的模糊测试工具 Taskflow Agent

    GitHub Security Lab 推出 Fuzzing Taskflow,这是一个用于 C/C++ 项目的自主模糊测试流水线。该工具利用 LLM Agent 自动识别入口点、编写 AFL++ Harness、分析覆盖率报告并分诊崩溃,最终生成漏洞报告。用户只需指定 GitHub 仓库即可启动,但需在隔离环境中运行以防范提示注入风险。

    推荐理由:GitHub Security Lab 开源了基于 LLM Agent 的自动化模糊测试流水线,展示了如何将编写 Harness、分析覆盖率和分诊崩溃等重复性安全工作交给 AI 处理。

9月23日周三
9月21日周一
9月18日周五
9月16日周三
9月12日周六
  1. GitHub Blog · AI & ML42

    GitHub 营销运营自动化实践:利用 Copilot 与 Actions 实现活动全流程代码化

    GitHub 日本及韩国市场团队利用 GitHub Copilot 和 Actions,将营销活动从策划到跟进转化为代码驱动的自动化流程。该方案以 Issue 为工作单元,通过标签触发工作流自动执行页面复制、UTM 链接生成及 CRM 数据同步等任务。这种“营销即代码”模式替代了传统手动操作,显著降低了跨工具重复性工作的出错率并提升了效率。

9月11日周五
  1. GitHub Blog · AI & ML35

    GitHub Copilot app 内置 diff、终端和浏览器面板简化代码审查

    GitHub Copilot app 新增内置面板,支持在应用内直接完成代码变更审查、运行与预览。用户可通过 diff 面板查看增删改行,利用终端面板执行命令或脚本,并借助浏览器面板的 Pick & Polish 工具实时调整 UI 元素。这一集成工作流消除了编辑器、终端与浏览器间的切换,让用户能安全验证并合并 AI 生成的代码。

9月9日周三
  1. Mistral AI66

    Mistral AI 分享使用智能体将 40,000 行 Fortran 77 代码迁移至 C++ 的实践

    Mistral AI 协助一家欧洲能源运营商,利用 AI 智能体将 40,000 行 Fortran 77 物理模拟代码成功迁移至 C++。团队首先构建了基于数值一致性的校验框架(parity harness),并通过 Vibe CLI 生成调用树以自动化文档整理。

    推荐理由:文章详细拆解了从构建数值校验框架到多智能体协作迁移Fortran代码的完整工程路径,为处理无测试遗留系统提供了可复用的结构化方法论。

9月5日周六
  1. GitHub Blog · AI & ML78

    GitHub 发布 Project HydraFusion:通过多模型编排实现前沿质量

    GitHub 推出 Project HydraFusion 研究预览,这是一种通过运行时多模型编排来提供前沿智能的新功能。它能在本地、云端和复合模型间自动进行语义路由,开发者只需像选择普通模型一样选择 HydraFusion,系统会自动规划执行路径以平衡性能、成本和延迟。

    推荐理由:GitHub 推出 HydraFusion 研究预览,通过多模型运行时编排实现前沿质量与成本平衡,提供实测数据与使用入口。

9月4日周五
9月3日周四
  1. Hugging Face Blog78

    Hugging Face 发布 funes:为编码智能体提供本地持久化记忆层

    Hugging Face 推出开源工具 funes,旨在为 Claude Code、Codex 等编码智能体提供本地持久化记忆层。它通过索引会话轨迹实现跨智能体和设备的上下文召回,支持私有数据集同步,并在基准测试中显示其成本低于传统上下文压缩或手动交接方案。

    推荐理由:该工具通过本地索引和检索机制,将编码智能体的会话记录转化为可跨设备共享的记忆层,解决了上下文丢失问题。

  2. Google DeepMind62

    Google DeepMind 推出 Fairwind 计划提供主动网络防御能力

    Google DeepMind 推出 Fairwind 计划,向政府、关键基础设施运营商及可信合作伙伴提供受限访问权限,以利用其先进的网络防御能力。该计划整合了 Gemini 3.8 Flash Cyber 模型与 CodeMender 框架,帮助防御者在安全的云环境中自主发现、验证并修复漏洞,将原本需数周的手动修补过程缩短至几分钟。

    推荐理由:原文给出了面向政府与企业的受限访问计划,读者可以据此判断其如何利用专用模型实现漏洞的自主发现与修复。

  3. Google DeepMind86

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 推出 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber 两款新模型,前者主打智能体工作流与编码,后者专攻网络安全防御。

    推荐理由:原文给出了两款新模型在长周期编码和网络安全领域的具体基准表现及定价,读者可据此评估其在自动化工作流中的实际效能与成本优势。

9月2日周三
  1. Google DeepMind78

    Google DeepMind 在 Gemini 中推出智能体视频理解功能

    Google DeepMind 宣布在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 模型中推出智能体视频理解功能。该功能通过让模型主动决定观看内容、速度和模态来替代固定帧率的静态处理,使 token 消耗最多降低 88%,成本最多减少 66%,准确率提升最高达 7%。

    推荐理由:官方给出了视频理解从静态处理转向智能体动态检索的技术路径,并提供了具体的成本与精度优化数据。

8月27日周四
  1. Google DeepMind78

    Google DeepMind 发布 Gemini 3.5 Transcribe 语音转文字模型

    Google DeepMind 发布最新语音转文字模型 Gemini 3.5 Transcribe,旨在实现精准且智能的实时转录。该模型在 Artificial Analysis 测试中达到流式 4.0% 和非流式 2.6% 的平均词错率,支持超过 85 种语言自动检测与转录,并具备处理自我纠正、去除填充词及自定义词汇的能力。

    推荐理由:原文给出了新模型的流式与非流式词错率数据及多语言支持范围,开发者可据此评估其在实时语音交互场景中的落地可行性。

8月26日周三
8月25日周二
  1. Hugging Face Blog71

    IBM Granite 4.2 LLMs 构建技术详解

    IBM 发布 Granite 4.2 推理模型家族,包含 3B、8B 和 30B 三种尺寸,均基于 Apache 2.0 许可证开源。这些模型通过五阶段策略在约 15T tokens 上预训练,并经过监督微调及多阶段强化学习管道训练,其中 8B 和 30B 版本额外进行了智能体强化学习以支持工具调用。所有模型均支持思考/非思考模式切换及原生工具调用,可通过 vLLM 等框架部署。

    推荐理由:原文详细拆解了从预训练到多阶段强化学习的完整技术路径,为开发者提供了复现或评估该系列模型能力的具体参考。

8月22日周六
  1. Google Research45

    Google Research 推出 Biomarker Discovery Framework:基于多智能体系统优先筛选可穿戴设备生物标志物

    Google Research 推出 Biomarker Discovery Framework,这是一个在人类监督下运行的多智能体系统,用于从可穿戴传感器数据中优先筛选候选生物标志物。该系统结合假设生成、统计分析与对抗验证,在三个队列(N=9,279)中识别出41个心理健康和25个代谢疾病候选数字生物标志物,并恢复了已知临床信号。

8月21日周五
8月19日周三
  1. Hugging Face Blog62

    IBM Research 提出 ALTK-Evolve 智能体记忆剂量校准方法

    IBM Research 发布关于 ALTK-Evolve 智能体记忆机制的研究,指出向上下文注入自蒸馏指南的效果取决于模型能力层级,需进行剂量校准而非简单累积。

    推荐理由:原文通过八模型对比实验,揭示了智能体记忆注入剂量需随模型能力校准,为低成本提升任务完成率提供了具体策略。

8月14日周五
  1. Hugging Face Blog77

    Hugging Face 发布 2026 夏季开源模型现状观察

    Hugging Face 发布 2026 年夏季开源模型现状报告,指出中国实验室在超大参数开源模型上占据主导,而美国厂商更多聚焦硬件优化与小模型分发。数据显示 Qwen 已成为社区基础模型,拥有超过 15 万个衍生仓库,且智能体首次成为 Hub 的第一大用户群体。报告强调点赞反映关注度而下载反映实际依赖,二者存在显著差异,并记录了针对平台的自主智能体入侵案例。

    推荐理由:报告通过区分点赞与下载数据,揭示了前沿模型声量与实际基础设施依赖之间的错位,为理解开源生态的真实采用率提供了关键视角。

  2. Google DeepMind84

    Google DeepMind 发布 Gemini 3.7 Flash

    Google DeepMind 发布 Gemini 3.7 Flash,这是其针对编码和智能体任务的最强主力模型。该版本在 FrontierCode 1.1 Main(43.6% vs 34.4%)和 DeepSWE v1.1(65.3% vs 49.0%)等基准上显著优于前代,并支持更高效的 Web 开发工作流。

    推荐理由:原文给出了新模型在编码与智能体任务上的具体基准提升及减半的入门价格,读者可据此评估其性价比。

8月13日周四