LeRobot 发布全球最大开源自动驾驶数据集 L2D
Yaak 与 Hugging Face LeRobot 团队联合发布 Learning to Drive (L2D) 数据集,这是目前全球最大的开源多模态自动驾驶数据集。
推荐理由:该数据集提供了大规模多模态驾驶数据及自然语言指令,支持端到端模型训练与社区协作扩展。
Yaak 与 Hugging Face LeRobot 团队联合发布 Learning to Drive (L2D) 数据集,这是目前全球最大的开源多模态自动驾驶数据集。
推荐理由:该数据集提供了大规模多模态驾驶数据及自然语言指令,支持端到端模型训练与社区协作扩展。
Hugging Face 推出基于 React Native 的移动端 LLM 推理教程,支持在 Android 和 iOS 设备上本地运行模型。该方案利用 llama.rn 加载 GGUF 文件,推荐 DeepSeek-R1-Distill-Qwen-1.5B 等小参数模型以平衡性能与隐私。
Cohere For AI 推出 Aya Vision 8B 和 32B 两款开源权重视觉语言模型(VLM),旨在解决多模态模型的多语言性能挑战。该系列基于 SigLIP2 视觉编码器和 Aya Expanse 语言模型,采用动态图像分块、Pixel Shuffle 降采样以及多模态模型合并等技术,支持 23 种语言的图像描述、视觉问答及 OCR 等任务。
推荐理由:Cohere For AI 发布 Aya Vision 系列开源多模态模型,通过合成标注与模型合并技术提升23种语言下的视觉理解能力。
Hugging Face 宣布与 JFrog 建立合作伙伴关系,将 JFrog 扫描器集成至 Hub 以增强模型安全。该扫描器通过解析代码深层分析来减少误报,能检测 pickle 及 Keras Lambda 层等格式中的恶意执行风险。所有公共模型仓库在推送文件时将自动接受扫描,无需用户额外操作。
Arize Phoenix 提供集中平台,支持对 Agent 进行实时追踪、评估与调试。结合 smolagents 和 OpenTelemetry,可自动捕获工具调用等执行步骤。利用 GPT-4o 作为 LLM-as-a-judge,能量化评估搜索结果的响应相关性。
Hugging Face 联合 IISc/ARTPARK 开放 Vaani 数据集,助力全球开发者构建覆盖印度 54 种语言的 AI 模型。该多模态数据集已开源 Phase 1(80 个地区),包含 790 小时转录音频及 70K 图像,支持语音识别、代码切换 ASR 及多模态 LLM 增强等任务。
Hugging Face 推出 FastRTC,这是一个专为 Python 设计的实时通信库,旨在简化实时音频和视频 AI 应用的构建。它内置了自动语音检测、轮次管理以及基于 Gradio 的 UI,支持 WebRTC 和 WebSocket,并可一键部署为 FastAPI 应用或获取免费电话号码进行通话测试。
推荐理由:该库通过封装 WebRTC 和自动语音检测,让 Python 开发者能低门槛构建实时音视频 AI 应用,并支持快速部署与电话接入。
Hugging Face 发布实验性功能 Remote VAEs,允许用户将潜在空间扩散模型的 VAE 解码过程委托给远程端点,从而降低本地 GPU 的显存占用并避免分块解码带来的质量损失。
推荐理由:原文提供了将 VAE 解码委托给远程端点的代码示例和显存对比数据,帮助开发者在低显存设备上优化扩散模型推理性能。
Google 发布了新一代多语言视觉语言编码器 SigLIP 2,包含 Base、Large、Shape Optimized 和 Giant (1B) 四种规模及多种分辨率变体。
Hugging Face 发布 SmolVLM2 系列模型,包含 2.2B、500M 和 256M 三种参数规模,旨在让视频理解能力在所有设备上运行。SmolVLM2 2.2B 在 Video-MME 基准测试中表现优于现有 2B 级模型,而 500M 和 256M 版本则提供了极小的内存占用。
推荐理由:原文给出了三种参数规模的视频理解模型及端侧部署方案,读者可以据此评估小模型在本地设备上的实际可用性。
Google 发布 PaliGemma 2 Mix 系列模型,这是基于 SigLIP 和 Gemma 2 架构的预训练 PaliGemma 2 模型的指令微调版本。
推荐理由:原文给出了PaliGemma 2 Mix在多种视觉语言任务上的表现对比及推理代码,读者可以据此评估其在下游任务微调中的实际效果。
Hugging Face Hub 新增 Hyperbolic、Nebius AI Studio 和 Novita 三个 Serverless Inference Providers,支持 DeepSeek-R1 和 Flux.1 等模型。
Fireworks.ai 正式成为 Hugging Face Hub 支持的推理提供商,用户可在模型页面及生态工具中直接调用其 serverless 推理服务。
Hugging Face 使用 Math-Verify 对 Open LLM Leaderboard 上所有 3,751 个提交模型进行了重新评估,以解决旧版 MATH-Hard 任务中因格式解析和符号比较导致的评分偏差问题。
推荐理由:原文展示了 Math-Verify 修复旧评估器缺陷的具体案例及重测数据,为开发者提供了更可靠的模型数学能力对比依据。
Hugging Face 官方博客发布技术指南,详细解析了如何在十亿级规模下优化文本分类、文本嵌入及视觉嵌入的推理成本与延迟。文章通过对比 DistilBERT、ModernBERT 和 ColQwen2 等模型在 NVIDIA L4 GPU 上的表现,给出了具体的批量大小(Batch Size)和虚拟用户数(VUs)配置建议,并指出视觉嵌入任务因架构复杂导致成本显著高于纯文本任务。
推荐理由:原文提供了针对十亿级推理任务的硬件选型与参数调优实测数据,读者可据此评估大规模分类和嵌入场景下的成本优化路径。
Hugging Face Hub 引入基于 Rust 的 xet-core 和 hf_xet 集成,采用内容定义分块(CDC)结合块聚合技术,将上传和下载速度提升 2-3 倍。
Hugging Face 推出开源视频数据集脚本,结合 video2dataset 覆盖小规模与大规模场景。该三阶段流水线利用 yt-dlp、Florence-2 及 Qwen2.5 等模型进行下载、过滤与标注。社区已基于此微调 CogVideoX-5B 实现 Crush 等特效。
Open R1 项目发布 OpenR1-Math-220k 大规模数学推理数据集,该数据集在 512 块 H100 GPU 上本地生成,包含经过 Math Verify 和 Llama3.3-70B-Instruct 双重验证的 220k 条正确推理轨迹。
推荐理由:原文公开了基于本地算力生成的大规模数学推理数据集及过滤流程,并展示了通过微调复现 DeepSeek R1 蒸馏效果的具体实验数据。
Hugging Face 与 2A2I、TII 等机构推出第二代 Open Arabic LLM Leaderboard,旨在解决初代版本在算力门槛与结果真实性上的局限。该榜单已吸引超 46,000 访客并收录逾 700 个模型,涵盖从 1B 到 70B+ 参数规模,成为阿拉伯语 NLP 社区最活跃的评测平台之一。
Hugging Face 发布开源项目 Open Deep Research,旨在复现 OpenAI Deep Research 的功能并公开其智能体框架。该项目利用 smolagents 库构建代码代理(CodeAgent),在 GAIA 验证集上达到 55.15% 的成绩,优于此前开源框架约 46% 的水平。
推荐理由:Hugging Face 开源了基于 smolagents 的 DeepResearch 复现框架,展示了代码代理在 GAIA 基准测试中相比传统 JSON 动作生成的显著性能提升。
Hugging Face 宣布将 Physical Intelligence 开发的 π0 和 π0-FAST 视觉语言动作(VLA)模型移植到 LeRobot 仓库中。
推荐理由:原文展示了将 Physical Intelligence 的机器人基础模型移植到 LeRobot 的过程,并提供了 PyTorch 版本的推理与微调代码及 FAST 动作分词器的使用方法。
Adyen和Hugging Face共同推出了DABstep(Data Agent Benchmark for Multi-step Reasoning),这是一个包含450多个真实世界数据分析任务的基准测试,旨在评估LLM和AI智能体的能力。
Hugging Face 更新 Open-R1 项目进展,旨在复现 DeepSeek-R1 缺失的训练管线和合成数据。团队已在 MATH-500 基准上验证评估结果,并将 GRPO 集成至 TRL v0.14 以支持并行训练。
推荐理由:原文公开了复现 DeepSeek-R1 的训练管线与合成数据生成细节,提供了可参考的工程实现方案。
Philipp Schmid发布教程,利用Group Relative Policy Optimization (GRPO) 算法和 Countdown Game 任务,成功复现了 DeepSeek R1 的“aha moment”。
推荐理由:原文提供了基于GRPO和Countdown游戏复现R1推理能力的完整代码与训练配置,展示了在有限算力下实现模型自我验证的具体路径。
Hugging Face 推出《AI tools for Art Newsletter》首期,回顾 2024 年图像与视频生成领域的关键突破。文章指出 Flux.1 在多项基准测试中超越 Midjourney v6.0 和 DALL·E 3,成为开源图像生成的新 SOTA。此外,InstantID 等免训练个性化技术显著提升了基于 SDXL 的零样本肖像生成质量。
Hugging Face 联合 AWS 提供在云端部署与微调 DeepSeek R1 及蒸馏模型的指南。开发者可通过 Inference Endpoints、SageMaker AI 或 Bedrock Marketplace 运行模型,其中 DeepSeek R1 推理成本为每小时 8.3 美元。
Hugging Face 宣布启动 Open-R1 项目,旨在系统性重建 DeepSeek-R1 的数据和训练流程。该项目计划通过蒸馏高质量推理数据集、复现纯强化学习管线以及展示多阶段训练方法,来填补官方未公开代码和数据集的空白,推动开源推理模型的发展。
推荐理由:原文详细拆解了 DeepSeek-R1 的训练配方并规划了复现路径,为社区提供了构建开源推理模型的具体方法论和数据策略参考。
Hugging Face 宣布在 Hub 模型页面及客户端 SDK 中正式集成 fal、Replicate、Sambanova 和 Together AI 四家 Serverless 推理提供商。用户可通过自定义 API Key 直连或经 HF 路由两种模式调用 DeepSeek-R1 等模型,PRO 用户每月获 $2 跨提供商通用额度。
推荐理由:原文展示了在 Hub 模型页直接调用多家第三方 Serverless 推理服务的统一入口与计费模式,为开发者提供了更灵活的模型部署选择。
Hugging Face Diffusers 团队发布博客,综述了当前开源视频生成模型(如 CogVideoX, Hunyuan, LTX-Video)的能力、局限性及技术架构。
推荐理由:文章梳理了开源视频生成模型的现状与局限,并提供了在 Diffusers 中通过量化、卸载等优化手段降低显存需求及微调的具体代码方案。
Hugging Face 宣布其开源智能体框架 smolagents 现已原生支持视觉语言模型(VLM)。该更新允许在智能体启动时直接传入图像列表,或通过回调函数在每一步执行后动态将截图等视觉数据注入内存。
推荐理由:smolagents 原生支持视觉语言模型,通过回调机制动态注入图像,使智能体能自主浏览网页并处理视觉信息。
Hugging Face 推出 SmolVLM-256M 和 SmolVLM-500M,其中 256M 版本号称是全球最小的视觉语言模型(VLM)。新模型采用更小的 SigLIP base patch-16/512 视觉编码器以支持更大图像分辨率,并优化了 tokenization 策略,在 transformers、MLX 和 ONNX 中可直接加载运行。
推荐理由:官方发布了256M和500M参数的SmolVLM,展示了在极小参数量下保持多模态性能的技术权衡与优化路径。
Hugging Face 与 FriendliAI 达成合作,将 Friendli Endpoints 作为部署选项集成至 Hugging Face Hub。开发者可通过“Deploy this model”按钮一键部署模型至 NVIDIA H100 GPU,利用连续批处理、原生量化及自动扩缩容技术实现高性能低成本推理。
Hugging Face 推出 TimmWrapper,允许用户在 🤗 transformers 生态系统中直接加载和使用任何 timm 计算机视觉模型。
推荐理由:原文提供了将timm模型接入transformers生态的具体代码示例,涵盖量化、微调和torch.compile加速等实用场景。
Hugging Face 推出 TGI Backends 架构,允许通过统一前端集成 vLLM、TensorRT-LLM 等推理引擎。该方案利用 Rust 重构 HTTP 与调度层以规避 Python GIL 限制,提升并发性能。计划于 2025 年第一季度集成 vLLM,并持续扩展对 NVIDIA、AWS 及 Google TPU 等硬件的支持。
Hugging Face 发布两款新的静态嵌入模型 sentence-transformers/static-retrieval-mrl-en-v1(英语检索)和 sentence-transformers/static-similarity-mrl-multilingual-v1(多语言相似度)。
推荐理由:官方发布了在CPU上比主流模型快100至400倍的静态嵌入模型,并公开了完整的训练策略与脚本,为端侧部署提供了高效方案。
Hugging Face 指出当前多数 AI Agents 基于 LLM 构建,具备分解任务并自主执行的能力。分析显示系统自主性越高,隐私与安全等风险越大,因此建议不开发能自行编写执行代码的全自主 Agent,而应聚焦于人类保留控制权的半自主模式。
Hugging Face 联合 LlamaIndex 发布 vdr-2b-multi-v1,这是专为多语言视觉文档检索设计的嵌入模型,支持将文档页面截图编码为密集向量而无需 OCR。
推荐理由:原文给出了无需 OCR 的多语言视觉文档检索方案,读者可以据此评估其在跨语言场景下的效率与精度。
Hugging Face 在 Open LLM Leaderboard 中集成碳足迹估算,分析自 2024 年 6 月以来评估的 3,000 多个开源大语言模型的推理能耗。数据显示社区微调模型通常比官方模型更具碳效率,Qwen-2.5-14B 和 Phi-3-Medium 展现出最佳的分数与排放比。
Hugging Face 推出 smolagents,这是一个旨在简化语言模型智能体能力的轻量级库。其核心特性是 CodeAgent,允许智能体以 Python 代码形式编写动作,相比传统的 JSON 工具调用具有更好的组合性和通用性,并支持通过 E2B 进行沙箱安全执行。
推荐理由:该库通过让智能体直接编写代码而非JSON来执行动作,并提供了沙箱执行与Hub集成,为构建灵活且安全的AI工作流提供了新的工程范式。
Hugging Face 发布教程指导如何使用 PyTorch 内置工具可视化训练过程中的 GPU 显存占用。文章详细解析了模型参数、优化器状态、激活值等组件的显存构成,并提供了一套估算总显存需求的数学公式及启发式方法。
推荐理由:文章拆解了PyTorch显存快照工具的使用,并给出了基于模型参数和激活值的显存估算公式,有助于开发者定位训练中的内存瓶颈。