跳到正文

全部动态

今日 42 条
7月1日周二
6月30日周一
6月28日周六
  1. Hugging Face Blog62

    NVIDIA 发布 Llama Nemotron Nano VL 8B 视觉语言模型

    NVIDIA 推出 Llama Nemotron Nano VL,这是一款基于 Llama-3.1-8B-Instruct 和 C-RADIOv2-VLM-H 架构的 8B 参数视觉语言模型,专为智能文档处理和 OCR 设计。

    推荐理由:原文给出了8B视觉语言模型在文档处理基准上的表现及部署入口,读者可以据此判断其在企业级自动化场景中的适用性。

6月26日周四
  1. Hugging Face Blog84

    Gemma 3n正式登陆开源生态,支持transformers、MLX等主流框架

    Gemma 3n现已全面支持transformers、timm、MLX、llama.cpp、Ollama等主流开源库,实现本地化多模态运行。该模型包含E2B和E4B两种规格,通过Per-Layer Embeddings技术将实际5B/8B参数的显存占用降至2GB/3GB,并首次引入MobileNet-v5视觉编码器与USM音频编码器。

    推荐理由:原文详细列出了Gemma 3n在主流开源库中的集成方式及显存优化原理,为开发者提供了从推理到微调的完整落地路径。

6月24日周二
6月23日周一
6月19日周四
6月18日周三
6月16日周一
6月12日周四
  1. Hugging Face Blog65

    Hugging Face Kernel Hub 五分钟入门教程

    Hugging Face 发布 Kernel Hub 使用教程,介绍如何通过 kernels 库直接加载预编译优化内核以替代复杂的手动构建流程。文中演示了集成 RMSNorm 内核的方法,并在 L4 GPU 上展示了最高约 1.97x 的推理加速效果。

    推荐理由:原文演示了通过一行代码加载预编译内核以替代手动构建,并给出了 RMSNorm 在特定硬件上的实测加速数据。

6月11日周三
  1. Hugging Face Blog68

    Hugging Face 联合 NVIDIA 推出 Training Cluster as a Service

    Hugging Face 在 GTC Paris 宣布与 NVIDIA 合作推出 Training Cluster as a Service,旨在让全球研究机构更易获取大型 GPU 集群以训练基础模型。

    推荐理由:原文介绍了 Hugging Face 与 NVIDIA 合作推出的 Training Cluster as a Service,读者可了解其按需获取 GPU 集群以训练基础模型的具体机制。

6月10日周二
  1. Mistral AI80

    Mistral AI 发布首个推理模型 Magistral

    Mistral AI 发布其首个推理模型 Magistral,分为开源的 Magistral Small(24B 参数)和企业版 Magistral Medium。

    推荐理由:原文给出了双版本参数规模、AIME2024 具体得分及多语言原生推理特性,读者可据此评估其在专业领域与合规场景下的实际能力边界。

6月9日周一
6月6日周五
  1. Hugging Face Blog65

    Hugging Face 发布 ScreenSuite:最全面的 GUI 智能体评估套件

    Hugging Face 发布 ScreenSuite,这是一个包含 13 个基准测试的综合评估套件,用于评估视觉语言模型(VLM)在感知、定位、单步操作和多步智能体等方面的能力。

    推荐理由:原文整合了13个GUI智能体基准并统一为纯视觉评估环境,提供了支持本地部署的Docker容器和快速启动指南。

6月5日周四
6月4日周三
  1. Mistral AI60

    Mistral AI 发布 Mistral Code 企业级 AI 编码助手

    Mistral AI 推出 Mistral Code,这是一款面向企业软件团队的 AI 编码助手,现已在 JetBrains IDEs 和 VSCode 开放私有测试。

    推荐理由:原文展示了面向企业的安全合规AI编码助手,整合了模型、IDE插件及私有化部署选项,适合关注代码安全与效率的团队评估。

6月3日周二
  1. Hugging Face Blog65

    H Company 发布 Holo1 GUI 自动化 VLM 家族及 Surfer-H 智能体

    H Company 在 Hugging Face Hub 上发布了 Holo1 系列动作视觉语言模型(Action VLMs)和 WebClick 基准测试。该系列包含 Holo1-3B 和 Holo1-7B 两个版本,基于 Qwen2.5-VL 架构,其中 Holo1-7B 在通用 UI 定位基准上达到 76.2% 的平均准确率。

    推荐理由:原文发布了专为GUI自动化设计的开源视觉语言模型家族及基准,提供了低成本实现网页任务自动化的具体性能数据。

  2. Hugging Face Blog65

    Hugging Face 发布 SmolVLA:基于社区数据训练的高效开源视觉语言动作模型

    Hugging Face 推出 SmolVLA-450M,这是一款紧凑的开源视觉语言动作(VLA)模型,专为机器人设计且可在消费级硬件上运行。该模型仅使用 LeRobot 社区共享的数据集进行预训练,在 LIBERO、Meta-World 模拟环境及 SO100/SO101 真实任务中表现优于 ACT 等更强基线。

    推荐理由:原文展示了仅用社区数据训练的紧凑视觉语言动作模型,在消费级硬件上实现高效推理并超越更大基线,为机器人研究提供了可复现的低门槛方案。

6月1日周日