跳到正文

全部动态

今日 12 条
3月19日周三
3月18日周二
  1. Hugging Face Blog73

    Hugging Face Hub 正式集成 Xet 存储系统

    Hugging Face 宣布将首个模型和数据集仓库从 LFS 迁移至 Xet 存储,标志着 Xet 正式在 Hub 上线。Xet 采用内容定义分块技术实现字节级去重,显著提升了大文件传输效率,例如内部数据库上传时间从 13 分钟缩短至十分之一秒。用户可通过加入等待列表启用新存储,未来 huggingface_hub 将自动集成 hf_xet 包以支持无缝升级。

    推荐理由:官方详述了从 LFS 迁移至 Xet 存储的工程实践与性能优化,为开发者提供了理解底层架构演进及获取新存储权益的参考。

  2. Hugging Face Blog77

    NVIDIA GTC 2025 发布 Cosmos Transfer、Physical AI Dataset 和 Isaac GR00T N1 等开源物理AI资源

    NVIDIA 在 GTC 2025 大会上发布了三项面向物理 AI 开发的开源成果:Cosmos Transfer 世界基础模型、Physical AI Dataset 数据集以及 NVIDIA Isaac GR00T N1 人形机器人推理模型。

    推荐理由:原文汇总了NVIDIA在GTC 2025发布的三款开源物理AI资源,涵盖世界模型、数据集及人形机器人基础模型,为开发者提供了具体的技术入口。

3月17日周一
  1. Mistral AI77

    Mistral AI 发布 Mistral Small 3.1 开源多模态模型

    Mistral AI 发布 Mistral Small 3.1,这是一款 Apache 2.0 许可的开源模型,支持 128k tokens 上下文窗口和多模态理解。该模型推理速度达 150 tokens/s,可在单张 RTX 4090 或 32GB RAM Mac 上运行,目前已上线 Hugging Face 和 La Plateforme API。

    推荐理由:官方公布小参数模型在文本、多模态及长上下文维度的性能数据与硬件适配细节,为端侧部署提供具体参考。

3月14日周五
3月13日周四
3月12日周三
  1. Hugging Face Blog92

    Google 发布 Gemma 3:支持多模态、140+语言及128k上下文的开源大模型

    Google 发布新一代开源多模态大模型 Gemma 3,包含 1B、4B、12B 和 27B 四种参数规模。除 1B 版本仅支持文本外,其余版本均支持图像输入,上下文窗口最高达 128k tokens,并支持 140 多种语言。

    推荐理由:原文详细列出了Gemma 3各尺寸参数、上下文长度及多语言支持,并提供了在Hugging Face生态中的具体部署与推理代码示例。

3月11日周二
3月10日周一
  1. OpenAI News62

    OpenAI 发布研究:通过监控思维链检测模型利用漏洞的行为

    OpenAI 发布了一项新研究,探讨如何通过监控大语言模型的思维链(Chain of Thought)来检测其利用系统漏洞或进行不当行为的情况。该研究指出,仅依靠输出结果难以发现隐蔽的违规意图,而实时分析内部推理过程能更有效地识别潜在风险。这一方法旨在提升模型在复杂任务中的可解释性与安全性,为后续的对齐工作提供技术参考。

    推荐理由:OpenAI 官方发布关于通过监控思维链来检测模型利用漏洞的研究,为理解大模型内部推理行为的安全评估提供了新视角。

3月7日周五
  1. Mistral AI78

    Mistral 发布 Mistral OCR:支持多模态文档理解与结构化输出

    Mistral AI 推出 Mistral OCR,这是一款专为文档理解设计的 API,能够以高准确率解析文本、表格、公式及图像等元素。该模型在多项基准测试中表现优于 Gemini-1.5-Pro 和 GPT-4o,支持原生多语言处理,单节点每分钟可处理高达 2000 页文档。

    推荐理由:官方发布了针对文档理解的专用 OCR 模型,提供了详细的基准测试数据对比和 API 定价策略,适合需要处理复杂多模态文档的开发者评估。

3月6日周四
3月4日周二
  1. Hugging Face Blog65

    Cohere For AI 发布 Aya Vision 8B/32B 开源多模态模型

    Cohere For AI 推出 Aya Vision 8B 和 32B 两款开源权重视觉语言模型(VLM),旨在解决多模态模型的多语言性能挑战。该系列基于 SigLIP2 视觉编码器和 Aya Expanse 语言模型,采用动态图像分块、Pixel Shuffle 降采样以及多模态模型合并等技术,支持 23 种语言的图像描述、视觉问答及 OCR 等任务。

    推荐理由:Cohere For AI 发布 Aya Vision 系列开源多模态模型,通过合成标注与模型合并技术提升23种语言下的视觉理解能力。

2月28日周五
2月27日周四
2月25日周二
  1. Hugging Face Blog78

    Hugging Face 发布 FastRTC:面向 Python 的实时通信库

    Hugging Face 推出 FastRTC,这是一个专为 Python 设计的实时通信库,旨在简化实时音频和视频 AI 应用的构建。它内置了自动语音检测、轮次管理以及基于 Gradio 的 UI,支持 WebRTC 和 WebSocket,并可一键部署为 FastAPI 应用或获取免费电话号码进行通话测试。

    推荐理由:该库通过封装 WebRTC 和自动语音检测,让 Python 开发者能低门槛构建实时音视频 AI 应用,并支持快速部署与电话接入。

2月24日周一
  1. Hugging Face Blog62

    Hugging Face 推出 Remote VAEs 以通过 Inference Endpoints 进行解码

    Hugging Face 发布实验性功能 Remote VAEs,允许用户将潜在空间扩散模型的 VAE 解码过程委托给远程端点,从而降低本地 GPU 的显存占用并避免分块解码带来的质量损失。

    推荐理由:原文提供了将 VAE 解码委托给远程端点的代码示例和显存对比数据,帮助开发者在低显存设备上优化扩散模型推理性能。

2月21日周五
2月20日周四
  1. Hugging Face Blog78

    Hugging Face 发布 SmolVLM2 系列模型,支持全设备视频理解

    Hugging Face 发布 SmolVLM2 系列模型,包含 2.2B、500M 和 256M 三种参数规模,旨在让视频理解能力在所有设备上运行。SmolVLM2 2.2B 在 Video-MME 基准测试中表现优于现有 2B 级模型,而 500M 和 256M 版本则提供了极小的内存占用。

    推荐理由:原文给出了三种参数规模的视频理解模型及端侧部署方案,读者可以据此评估小模型在本地设备上的实际可用性。

2月19日周三
2月18日周二
2月17日周一
  1. Mistral AI45

    Mistral Saba 发布:面向中东与南亚的 24B 区域语言模型

    Mistral AI 推出首个区域专用模型 Mistral Saba,这是一款拥有 24B 参数的模型,专为中东和南亚地区训练。该模型支持阿拉伯语及多种印度起源语言,在响应速度超过 150 tokens/s 的同时,准确率优于体积大其 5 倍的通用模型。Mistral Saba 提供 API 服务并支持本地部署,可运行于单 GPU 系统,适用于对话支持、领域专家系统及文化内容创作等场景。

2月14日周五
  1. Hugging Face Blog73

    Hugging Face 用 Math-Verify 重新评估 Open LLM Leaderboard 全部模型

    Hugging Face 使用 Math-Verify 对 Open LLM Leaderboard 上所有 3,751 个提交模型进行了重新评估,以解决旧版 MATH-Hard 任务中因格式解析和符号比较导致的评分偏差问题。

    推荐理由:原文展示了 Math-Verify 修复旧评估器缺陷的具体案例及重测数据,为开发者提供了更可靠的模型数学能力对比依据。