Hugging Face smolagents 新增对视觉语言模型的支持
Hugging Face 宣布其开源智能体框架 smolagents 现已原生支持视觉语言模型(VLM)。该更新允许在智能体启动时直接传入图像列表,或通过回调函数在每一步执行后动态将截图等视觉数据注入内存。
推荐理由:smolagents 原生支持视觉语言模型,通过回调机制动态注入图像,使智能体能自主浏览网页并处理视觉信息。
Hugging Face 宣布其开源智能体框架 smolagents 现已原生支持视觉语言模型(VLM)。该更新允许在智能体启动时直接传入图像列表,或通过回调函数在每一步执行后动态将截图等视觉数据注入内存。
推荐理由:smolagents 原生支持视觉语言模型,通过回调机制动态注入图像,使智能体能自主浏览网页并处理视觉信息。
OpenAI 发布 Operator 系统卡,详述其多层安全防护体系。文档涵盖针对提示工程与越狱攻击的模型及产品缓解措施、隐私安全保护机制,以及外部红队测试与安全评估细节。
Hugging Face 指出当前多数 AI Agents 基于 LLM 构建,具备分解任务并自主执行的能力。分析显示系统自主性越高,隐私与安全等风险越大,因此建议不开发能自行编写执行代码的全自主 Agent,而应聚焦于人类保留控制权的半自主模式。
Hugging Face 推出 smolagents,这是一个旨在简化语言模型智能体能力的轻量级库。其核心特性是 CodeAgent,允许智能体以 Python 代码形式编写动作,相比传统的 JSON 工具调用具有更好的组合性和通用性,并支持通过 E2B 进行沙箱安全执行。
推荐理由:该库通过让智能体直接编写代码而非JSON来执行动作,并提供了沙箱执行与Hub集成,为构建灵活且安全的AI工作流提供了新的工程范式。
Rox 宣布全面采用 OpenAI 模型,结合商业经验与大语言模型技术。该方案旨在通过 AI 能力优化销售流程,使每位销售人员都能达到前 1% 的销售表现水平。
Mistral AI 宣布为其免费生成式 AI 助手 le Chat 推出多项 Beta 新功能,包括带引用的联网搜索、用于创意构思和行内编辑的 Canvas 界面、基于 Pixtral Large 的文档与图像理解能力,以及由 Black Forest Labs Flux Pro 驱动的图像生成功能。
推荐理由:Mistral 为 le Chat 集中上线了联网搜索、Canvas 画布及多模态理解等 Beta 功能,展示了其从模型层向应用层整合的完整工作流方案。
OpenAI 推出 MLE-bench,这是一个用于衡量 AI 智能体在机器学习工程任务中表现的基准测试。该基准旨在量化评估智能体执行具体机器学习工程工作的能力水平。
Altera 使用 GPT-4o 构建全新的人机协作领域。该应用展示了大语言模型在增强人类与 AI 协同工作方面的潜力,为相关场景提供了新的技术实现路径。
HuggingFace 在 HuggingChat 中发布 Community Tools 功能,允许用户将任何公开的 HuggingFace Space 转化为模型可直接调用的工具。
推荐理由:官方展示了将任意 Space 转为工具的流程,并提供了 RAG 模板,读者可据此扩展聊天助手的多模态能力。
Mistral AI 在 La Plateforme 上线模型定制功能,支持对 Mistral Large 2 和 Codestral 进行微调。同时推出 Agents Alpha 版本,允许通过指令和示例构建自定义工作流。此外,mistralai 客户端 SDK 发布 1.0 稳定版,覆盖 Python 和 TypeScript。
Hugging Face 使用基于 transformers.agents(现已升级为 smolagents)构建的 ReactCodeAgent 在 GAIA 基准验证集上取得 44.2% 的成绩,位列第一。该方案核心在于让 LLM 生成并执行 Python 代码而非 JSON,通过自底向上构建的安全解释器限制操作权限,并结合 Web 浏览、文件检查等工具及简单的规划组件实现多智能体协作。
推荐理由:原文详细拆解了基于代码动作的 Agent 架构与安全执行机制,并展示了在 GAIA 基准上的具体得分与多智能体编排策略。
Hugging Face 联合 Cubzh 和 Gigax 发布 NPC-Playground,这是一个可在浏览器中直接体验的 3D 演示,允许用户与由大语言模型驱动的非玩家角色(NPC)进行交互。该工具利用 Phi-3 和 Mistral-7B 微调模型实现智能对话与动作执行,并支持通过 Lua 脚本自定义 NPC 技能。
MavenAGI 推出基于 GPT-4 的 AI 客服智能体,Tripadvisor、Clickup 和 Rho 等公司已开始使用。该方案旨在帮助企业节省时间并提升客户服务体验。
Hugging Face 发布 Transformers Agents 2.0,引入基于过去观察迭代解决复杂任务的新智能体类型,并将该模块升级为独立库 smolagents。新框架强调代码清晰性与模块化,支持社区共享选项,实测显示基于 Llama-3-70B-Instruct 的智能体在 GAIA Leaderboard 上超越了多个 GPT-4 基线智能体。
推荐理由:官方展示了新框架在GAIA基准测试中超越GPT-4智能体的实测数据,并提供了从Transformers迁移到独立库smolagents的清晰路径。
Hugging Face 发布指南介绍如何利用 LangChain 中的 ChatHuggingFace 类构建基于开源大语言模型的 ReAct 智能体。文章详细拆解了智能体的推理与行动循环机制,并提供了代码示例。
OpenAI 正式推出 GPTs,这是一项新功能,允许用户通过自然语言对话轻松创建个性化的 ChatGPT 版本。用户可以自定义指令、上传知识文件并配置外部动作,从而构建针对特定任务或领域的专用智能体,且全程无需编写代码。
推荐理由:OpenAI 官方发布 GPTs,允许用户通过自然语言创建定制化的 AI 助手,无需编写代码即可结合指令、知识和动作。
Hugging Face 发布 Agents.js,这是一个允许在浏览器或服务器端通过 JavaScript 赋予大语言模型工具访问权限的新库。该库默认使用 OpenAssistant/oasst-sft-4-pythia-12b-epoch-3.5 模型,支持自定义 LLM 及扩展多模态工具,但直接运行代码存在安全风险,建议配合 generateCode 和 evaluateCode 方法使用。
Hugging Face 发布 AI 游戏开发系列第五篇,演示利用 ChatGPT 生成农场游戏故事大纲及物品描述。文章指出语言模型存在复现既有剧情、长文本质量漂移及重复等局限,并提示直接商用可能引发法律与伦理风险。建议将 AI 作为头脑风暴工具,通过多轮迭代优化后由人工撰写最终内容。
Hugging Face 梳理了 ChatGPT 成功的关键技术,包括 RLHF、SFT、IFT 和 CoT。文章对比了 LaMDA、BlenderBot 3、Sparrow、InstructGPT 及 Claude 等对话智能体在模型规模、训练数据及评估标准上的异同。重点阐释了指令微调(IFT)如何提升模型遵循指令能力,以及监督微调(SFT)在确保回复安全与有用性中的作用。
OpenAI 观察到智能体在模拟“捉迷藏”游戏中通过训练自发发现了逐步复杂的工具使用行为。这些智能体构建了六种不同的策略与反策略,其中部分能力是环境原本未明确支持的。这种简单环境中的自监督涌现复杂性表明,多智能体共同适应未来可能产生极其复杂和智能的行为。
OpenAI 推出名为 CoinRun 的强化学习训练环境,旨在量化智能体将经验迁移至新情境的能力。该环境复杂度介于传统平台游戏与简单测试之间,为前沿算法提供了有效的泛化挑战基准,并有助于澄清强化学习领域的长期谜题。
OpenAI Five 在基准测试中三局两胜击败由 Blitz、Cap、Fogged、Merlini 和 MoonMeander 组成的 Dota 职业选手团队。该对手为 percentile 99.95 的顶尖玩家,其中四人拥有职业经历。比赛面向现场观众及 100,000 名直播并发观众进行。
OpenAI 训练的智能体仅凭单次人类演示,在 Montezuma’s Revenge 游戏中取得 74,500 分的高分,超越此前所有已发表结果。该算法从演示中精心选择的状态开始游戏序列,并使用 PPO 强化学习算法优化得分以进行学习。
OpenAI 开发了一种分层强化学习算法,能够学习适用于多种任务的高层动作,从而快速解决需要数千个时间步的任务。在导航问题测试中,该算法发现了不同方向的行走和爬行等高层动作,使智能体能迅速掌握新的导航任务。
OpenAI 指出多智能体竞争环境是通往 AGI 的垫脚石。这类环境具备自然课程和动态压力两大特性,能随对手能力自动调整难度并持续推动智能提升。目前相关研究尚处于早期阶段,与传统环境差异显著。