跳到正文

#教程/实践

今日 6 条
今天10月2日周五
  1. AWS Machine Learning Blog58

    AWS 教程:基于 Amazon Bedrock AgentCore Runtime Instances 构建多智能体音乐制作流水线

    AWS 发布教程,指导开发者使用 Amazon Bedrock AgentCore Runtime Instances 构建包含作曲、交付和合规三个智能体的音乐制作流水线。该方案利用共享会话 ID 实现多智能体在同一 GPU 实例上的共置与文件系统共享,支持长达 14 天的持久化工作流及混合制品类型的独立部署。

  2. AWS Machine Learning Blog42

    AWS 使用上下文多臂老虎机优化 Amazon Payments 转化漏斗

    Amazon Payments 在 Amazon SageMaker AI 上部署多目标上下文多臂老虎机(MAB)以个性化产品获取漏斗。七周 A/B 测试显示,特定客户群体最终转化率提升高个位数百分比,但另一群体无改善,表明瓶颈在于内容而非模型。该方案采用 LinUCB 算法,基于行为信号向量进行实时决策与探索平衡。

  3. AWS Machine Learning Blog47

    基于 Amazon Bedrock AgentCore 构建环境感知智能体:从事件驱动信号到人在回路工作流

    Amazon Bedrock AgentCore 支持构建环境感知智能体,该模式通过监听 S3 或 EventBridge 等事件流自动触发任务,并利用 ask_human 工具实现人在回路交互。此方案结合 Lambda 与 DynamoDB 形成无服务器架构,解决了传统聊天式智能体无法并行处理基础设施事件的局限,提升了自动化流程的可靠性与扩展性。

10月1日周四
  1. AWS Machine Learning Blog25

    uniopen 定制 Amazon Nova 2 Lite 实现零售内容审核生产部署

    uniopen 通过监督微调将 Amazon Nova 2 Lite 适配至其零售审核策略,并在 Amazon SageMaker AI 中完成训练与部署。该方案结合提示词优化,在包含 737 个对话窗口的测试集上评估行为分类与主体识别性能。架构采用人工验证反馈闭环,利用硬/软门控机制控制模型晋升,确保生产环境下的合规性与稳定性。

9月30日周三
  1. AWS Machine Learning Blog26

    Amazon Quick 各组件提示词工程模式与陷阱

    Amazon Quick 系列文章详解 Research、Flows 和 Sight 的提示词最佳实践。Quick Research 需明确目标受众并限定 S&P Global 等数据源;Quick Flows 应使用编号步骤定义触发条件与逻辑;Quick Sight 查询需包含业务问题、指标及维度以优化可视化结果。

9月29日周二
9月26日周六
  1. GitHub Blog · AI & ML63

    GitHub Copilot 应用入门:如何用 canvases 构建自定义工作流

    GitHub Copilot 应用推出 canvases 功能,允许用户通过 `/create-canvas` 技能用自然语言描述生成可定制的双向交互界面。该界面支持看板、清单等多种形态,用户与智能体可实时同步操作状态,无需编写代码即可创建并复用扩展工具。

    推荐理由:原文演示了如何通过自然语言描述生成双向交互界面,为构建个性化智能体工作流提供了具体方法。

9月25日周五
  1. GitHub Blog · AI & ML68

    GitHub Copilot 提出用 canvas 替代聊天作为主要交互界面

    GitHub Copilot 推出 canvas 功能,允许用户在应用内创建全栈自定义界面以替代传统聊天窗口进行交互。canvas 支持双向通信和本地代码执行,可用于构建如 Connect 4 游戏、Winget 包管理器等工具,从而减少不必要的 token 消耗并提升开发工作流的自动化程度。

    推荐理由:文章通过具体案例展示了如何利用 canvas 构建自定义交互界面,帮助开发者优化与 AI 智能体的协作流程。

  2. GitHub Blog · AI & ML78

    GitHub Security Lab 发布 AI 驱动的模糊测试工具 Taskflow Agent

    GitHub Security Lab 推出 Fuzzing Taskflow,这是一个用于 C/C++ 项目的自主模糊测试流水线。该工具利用 LLM Agent 自动识别入口点、编写 AFL++ Harness、分析覆盖率报告并分诊崩溃,最终生成漏洞报告。用户只需指定 GitHub 仓库即可启动,但需在隔离环境中运行以防范提示注入风险。

    推荐理由:GitHub Security Lab 开源了基于 LLM Agent 的自动化模糊测试流水线,展示了如何将编写 Harness、分析覆盖率和分诊崩溃等重复性安全工作交给 AI 处理。

9月24日周四
  1. GitHub Blog · AI & ML55

    GitHub Copilot App 如何渲染包含百万行变更的超大 Pull Request

    GitHub Copilot App 重构了 Pull Request 视图以支持包含 2,200 个文件和超过 100 万行变更的超大 PR 流畅渲染。针对代码行高度确定但评论块高度动态变化的矛盾,团队将文档高度拆分为确定性代码几何域和动态块几何域,并采用空闲滚动门控的单次批量测量调度器替代逐块 ResizeObserver 以避免布局反馈循环。

9月17日周四
  1. GitHub Blog · AI & ML86

    GitHub Copilot 运行时迁移至 Rust 的实践:AI 智能体辅助的大规模代码重写

    GitHub Copilot 团队使用 AI 智能体将 Copilot agent runtime 从 TypeScript 完全重写为超过 800,000 行生产级 Rust 代码。

    推荐理由:原文详细记录了利用 AI 智能体将 GitHub Copilot 运行时从 TypeScript 迁移至 Rust 的全过程,展示了在大规模代码重写中如何通过增量合并、自动化测试和子代理协作来保证稳定性与效率。

9月12日周六
  1. GitHub Blog · AI & ML42

    GitHub 营销运营自动化实践:利用 Copilot 与 Actions 实现活动全流程代码化

    GitHub 日本及韩国市场团队利用 GitHub Copilot 和 Actions,将营销活动从策划到跟进转化为代码驱动的自动化流程。该方案以 Issue 为工作单元,通过标签触发工作流自动执行页面复制、UTM 链接生成及 CRM 数据同步等任务。这种“营销即代码”模式替代了传统手动操作,显著降低了跨工具重复性工作的出错率并提升了效率。

9月11日周五
  1. GitHub Blog · AI & ML35

    GitHub Copilot app 内置 diff、终端和浏览器面板简化代码审查

    GitHub Copilot app 新增内置面板,支持在应用内直接完成代码变更审查、运行与预览。用户可通过 diff 面板查看增删改行,利用终端面板执行命令或脚本,并借助浏览器面板的 Pick & Polish 工具实时调整 UI 元素。这一集成工作流消除了编辑器、终端与浏览器间的切换,让用户能安全验证并合并 AI 生成的代码。

9月10日周四
  1. Hugging Face Blog68

    Hugging Face 演示基于 Jobs 和 LoRA 的异步 GRPO 训练优化

    Hugging Face 博客介绍了在 HF Jobs 上使用 AsyncGRPOTrainer 进行 LoRA 微调的实践方案。该方案利用 Storage Bucket 挂载实现训练器与 vLLM 副本间的适配器同步,无需 NCCL 通信。

    推荐理由:原文展示了利用存储桶同步LoRA适配器以解耦训练与推理的架构,并提供了通过指标分析将训练提速近4倍的具体调优路径。

9月9日周三
  1. Mistral AI66

    Mistral AI 分享使用智能体将 40,000 行 Fortran 77 代码迁移至 C++ 的实践

    Mistral AI 协助一家欧洲能源运营商,利用 AI 智能体将 40,000 行 Fortran 77 物理模拟代码成功迁移至 C++。团队首先构建了基于数值一致性的校验框架(parity harness),并通过 Vibe CLI 生成调用树以自动化文档整理。

    推荐理由:文章详细拆解了从构建数值校验框架到多智能体协作迁移Fortran代码的完整工程路径,为处理无测试遗留系统提供了可复用的结构化方法论。

9月4日周五
9月3日周四
  1. Hugging Face Blog61

    Hugging Face 发布使用 GRPO 微调 LFM2.5-350M 提升结构化输出的教程

    Hugging Face 发布教程,演示如何使用 TRL 库和 GRPO 算法微调 LFM2.5-350M 模型以改善结构化输出能力。该方案仅需约 500 个样本和 100 步训练,可在免费 Colab 或 Kaggle GPU 上运行,使模型在 IFStruct 基准测试中的得分从 22.6% 提升至 29.7%,显著缩小了与小参数模型和大模型之间的差距。

    推荐理由:展示了在免费 GPU 上通过少量步骤微调小模型以提升结构化输出合规性的完整流程与实测效果。

  2. Hugging Face Blog78

    使用 TRL 和 OpenEnv 训练编码模型绘制水彩画的开源复现指南

    作者基于 Hugging Face 平台完整复现了通过强化学习训练大语言模型编写 JavaScript 代码以生成水彩画的过程,并开源了所有训练脚本、环境和数据集。文章详细解析了结合 HPSv3 评分与 Qwen3-VL-30B-A3B-Instruct 视觉判断器的奖励机制设计,对比了三种不同权重配置的实验结果,展示了如何利用人工筛选的图像池引导模型学习特定审美风格。

    推荐理由:完整公开了基于TRL和OpenEnv的强化学习训练代码、环境配置及三种奖励混合策略的实验对比,为复现美学偏好模型提供了可迁移的工程参考。

8月26日周三
  1. Hugging Face Blog75

    Sentence Transformers 多向量嵌入模型微调教程

    Sentence Transformers v6.0 引入 MultiVectorEncoder 以支持 ColBERT 风格的后期交互检索,本文详解其微调流程。作者展示了如何在单张 RTX 3090 上通过 14.5 小时训练出超越通用模型的医疗领域检索器,并提供了从数据加载、损失函数选择到索引优化的完整代码示例。

    推荐理由:原文给出了多向量模型微调的完整代码与实测对比,读者可据此在单卡上复现针对特定领域的检索增强方案。

8月21日周五
8月18日周二
8月14日周五
  1. Hugging Face Blog62

    Strands Agents 与 LeRobot 结合 Hugging Face Storage Buckets 实现机器人数据流式循环教程

    AWS Strands Robots SDK 与 Hugging Face LeRobot 及 Storage Buckets 集成,提供了一套完整的机器人数据流式处理工作流。该流程允许通过 Agent 录制演示数据并同步至 Bucket,利用 Xet 字节级去重技术减少传输开销,随后直接从 Hub 流式读取数据进行模型训练,最后将训练好的策略部署回硬件,全程无需本地下载完整数据集。

    推荐理由:原文完整演示了从录制、同步到流式训练和部署的闭环流程,读者可以据此了解如何避免重复下载数据并直接在 Hub 上训练机器人策略。

7月10日周五
  1. Hugging Face Blog52

    PyTorch 注意力机制 Profiling 实战:从朴素实现到 SDPA 后端解析

    Hugging Face 发布 PyTorch Profiling 系列第三篇,深入解析注意力机制的性能特征。文章对比了朴素注意力、原地操作优化以及 SDPA 的 math、efficient、flash 和 cuDNN 四种后端在 GPU Kernel 启动数量、Tensor Core 利用率及 CPU 开销上的差异,展示了如何通过 Profiler 轨迹识别隐藏内存拷贝与算子融合效果。

7月6日周一
6月26日周五
  1. Hugging Face Blog68

    Hugging Face 教程:用一条命令在 HF Jobs 上运行 vLLM 服务器

    Hugging Face 发布教程,指导用户通过 `hf jobs run` 命令在 HF Jobs 基础设施上快速启动私有且兼容 OpenAI API 的 vLLM 服务器。

    推荐理由:原文提供了在 Hugging Face Jobs 上通过单条命令快速启动 vLLM 服务的具体步骤、代码示例及与 Inference Endpoints 的选型对比,适合需要临时测试或批量生成模型的开发者参考。

6月25日周四
6月23日周二
  1. Hugging Face Blog68

    Hugging Face 分享基于 AI 和开源工具的每周自动发布实践

    Hugging Face 公开了 huggingface_hub 的自动化发布工作流,将发布频率从每4-6周提升至每周一次。该流程利用 GitHub Actions、OpenCode 和 GLM-5.2 模型起草发布说明,并通过确定性脚本校验 PR 完整性及文档准确性,确保在保留人工审核关键决策的同时实现低成本高效交付。

    推荐理由:文章展示了如何用开源工具构建自动化发布流程,其确定性校验机制为AI辅助开发提供了可复用的安全范式。

  2. Hugging Face Blog62

    在 Transformers.js 中实验跨源存储 API 以优化浏览器端缓存

    Transformers.js 正在实验性地集成 Chrome 团队提出的跨源存储(Cross-Origin Storage, COS)API,旨在解决不同 Web 应用间共享大型 AI 模型和 Wasm 运行时文件时的重复下载与存储隔离问题。

    推荐理由:文章详细演示了如何利用跨源存储 API 解决浏览器端 AI 模型重复下载问题,提供了 Transformers.js 的具体集成代码与隐私控制策略。

6月22日周一
  1. Hugging Face Blog73

    Hugging Face 分享使用本地模型对 OpenClaw 仓库进行免费分诊的实践

    Hugging Face 介绍了如何使用 Gemma 和 Qwen 等本地模型结合 Pi Agent 框架,对 OpenClaw 仓库的海量 Issue 和 PR 进行实时分类与通知。该方案通过受限 Shell 确保安全性,并在 NVIDIA GB10 硬件上实现了高并发推理,相比云端 API 具有成本优势且响应更快。

    推荐理由:展示了在本地硬件上利用 Agent 框架实现高吞吐开源仓库自动分诊的完整工程方案与评测数据。

6月18日周四
  1. Hugging Face Blog58

    Hugging Face 解析 PEFT 技术:LoRA 并非微调的最优默认选择

    Hugging Face 发布博客探讨参数高效微调(PEFT)技术,指出虽然 LoRA 占据主导地位,但其他技术在特定场景下表现更优。团队在 LLM 数学推理和图像生成任务上对超过 40 种 PEFT 技术进行了标准化基准测试,结果显示 OFT 在图像生成的相似度和显存占用上均优于 LoRA,而 BEFT 和 Lily 等变体在 LLM 任务的精度与内存权衡中也展现出竞争力。

  2. Hugging Face Blog78

    Hugging Face 发布 agent-eval 基准测试工具以评估开源模型在自有工具上的表现

    Hugging Face 推出名为 `agent-eval` 的基准测试工具,用于衡量编码智能体使用特定软件(如 transformers)完成任务时的效率与成本,而不仅关注最终答案的正确性。该工具通过对比不同模型、代码版本及上下文层级(bare/clone/skill),发现为大型开放模型引入 CLI 和 Skill 能显著减少耗时,但可能导致小型模型因误解文档或读取过多源码而性能下降甚至失败。

    推荐理由:原文提供了评估代码库对智能体友好程度的具体方法,揭示了同一工具改进对不同规模模型产生的相反影响。

6月17日周三
  1. Hugging Face Blog78

    AWS Strands Robots 集成 LeRobot 实现从 Hub 数据集到物理机器人的全流程指南

    AWS 开源 SDK Strands Robots 集成了 Hugging Face LeRobot 栈,允许开发者通过单个 Agent 循环完成从 Hub 数据集记录、策略训练到物理机器人部署的全流程。

    推荐理由:原文提供了从 Hub 数据集到物理机器人的完整代码示例,展示了如何用单一 Agent 循环统一仿真与硬件部署流程。

6月11日周四
  1. Hugging Face Blog61

    PyTorch Profiling 系列第二篇:从 nn.Linear 到融合 MLP 的内核解析

    Hugging Face 发布 PyTorch Profiling 教程第二部分,深入解析从 nn.Linear 到多层感知机(MLP)的性能剖析。文章展示了 bias 加法如何通过 epilogue 融入 GEMM 内核,以及 torch.compile 如何将 GeLU 和乘法操作融合为单个 Triton 内核以减少 HBM 往返。

    推荐理由:通过对比 eager、compile 和手写 kernel 的 profiler trace,揭示了 PyTorch 中算子融合与内存访问优化的具体机制及权衡。