跳到正文

全部动态

今日 12 条
1月23日周四
  1. Hugging Face Blog65

    Hugging Face 发布 SmolVLM-256M 与 SmolVLM-500M 超小型视觉语言模型

    Hugging Face 推出 SmolVLM-256M 和 SmolVLM-500M,其中 256M 版本号称是全球最小的视觉语言模型(VLM)。新模型采用更小的 SigLIP base patch-16/512 视觉编码器以支持更大图像分辨率,并优化了 tokenization 策略,在 transformers、MLX 和 ONNX 中可直接加载运行。

    推荐理由:官方发布了256M和500M参数的SmolVLM,展示了在极小参数量下保持多模态性能的技术权衡与优化路径。

1月22日周三
1月21日周二
1月16日周四
  1. Mistral AI38

    Mistral AI 与 AFP 达成合作,Le Chat 接入法新社新闻源

    Mistral AI 宣布与法新社(AFP)建立全球合作伙伴关系,其 AI 助手 Le Chat 将接入 AFP 的新闻通讯内容。该集成旨在利用 AFP 每日以六种语言发布的 2,300 条新闻线,提升 Le Chat 回答的事实准确性与时效性。这一功能将在未来几周内逐步向所有 Le Chat 用户推出。

1月15日周三
  1. OpenAI News21

    OpenAI 与 Axios 合作扩展新闻行业工作

    OpenAI 宣布与 Axios 建立合作伙伴关系,旨在进一步拓展其在新闻行业的协作范围。目前,代表数百家新闻编辑室和内容品牌的出版商正利用 OpenAI 的合作项目及资助计划采用 AI 工具,以强化新闻生态系统。同时,ChatGPT 用户也能借此获取来自领先且可靠出版物的信息。

  2. Hugging Face Blog62

    Hugging Face 发布高速静态嵌入模型 static-retrieval-mrl-en-v1 和 static-similarity-mrl-multilingual-v1

    Hugging Face 发布两款新的静态嵌入模型 sentence-transformers/static-retrieval-mrl-en-v1(英语检索)和 sentence-transformers/static-similarity-mrl-multilingual-v1(多语言相似度)。

    推荐理由:官方发布了在CPU上比主流模型快100至400倍的静态嵌入模型,并公开了完整的训练策略与脚本,为端侧部署提供了高效方案。

1月14日周二
1月13日周一
  1. Mistral AI65

    Mistral AI 发布 Codestral 25.01 编码模型

    Mistral AI 发布 Codestral 25.01,采用更高效架构和改进的 tokenizer,代码生成与补全速度约为原版的 2 倍。该模型在 FIM(fill-in-the-middle)用例中达到 SOTA,上下文长度扩展至 256k,并在 HumanEval 等基准测试中领先于同量级模型。

    推荐理由:原文给出了新模型的架构改进、速度提升及多语言基准数据,读者可据此评估其在代码补全场景下的实际性能优势。

1月10日周五
1月9日周四
12月31日周二
  1. Hugging Face Blog82

    Hugging Face 发布 smolagents:支持代码动作的轻量级智能体库

    Hugging Face 推出 smolagents,这是一个旨在简化语言模型智能体能力的轻量级库。其核心特性是 CodeAgent,允许智能体以 Python 代码形式编写动作,相比传统的 JSON 工具调用具有更好的组合性和通用性,并支持通过 E2B 进行沙箱安全执行。

    推荐理由:该库通过让智能体直接编写代码而非JSON来执行动作,并提供了沙箱执行与Hub集成,为构建灵活且安全的AI工作流提供了新的工程范式。

12月27日周五
12月24日周二
  1. Hugging Face Blog68

    Hugging Face 发布 PyTorch GPU 显存可视化与估算教程

    Hugging Face 发布教程指导如何使用 PyTorch 内置工具可视化训练过程中的 GPU 显存占用。文章详细解析了模型参数、优化器状态、激活值等组件的显存构成,并提供了一套估算总显存需求的数学公式及启发式方法。

    推荐理由:文章拆解了PyTorch显存快照工具的使用,并给出了基于模型参数和激活值的显存估算公式,有助于开发者定位训练中的内存瓶颈。

12月23日周一
12月20日周五
  1. Hugging Face Blog62

    Artificial Analysis 发布 Big Bench Audio 数据集以评估音频推理能力

    Artificial Analysis 发布 Big Bench Audio 数据集,用于评估音频语言模型的推理能力。该数据集改编自 Big Bench Hard,包含 1000 个音频问题,涵盖逻辑演绎、导航和计数等类别。

    推荐理由:原文通过对比不同音频处理模式,量化了原生语音模型在复杂推理任务上的性能落差,为评估语音智能体能力提供了具体基准数据。

12月19日周四
12月18日周三
  1. Hugging Face Blog68

    IBM 等机构发布 Bamba-9B 混合 Mamba2 模型

    IBM、普林斯顿大学、卡内基梅隆大学和伊利诺伊大学香槟分校联合推出 Bamba-9B,这是一款完全使用开放数据训练的混合 Mamba2 模型。在 vLLM 框架下,该模型相比标准 Transformer 实现了 2.5 倍吞吐量提升和 2 倍延迟加速。目前模型已支持 transformers、vLLM、TRL 和 llama.cpp,并公开了包含有状态数据加载器在内的训练与微调配方。

    推荐理由:IBM 联合高校发布基于开放数据训练的混合 Mamba2 模型,提供显著推理效率提升及完整训练复现资源。

12月17日周二
  1. Hugging Face Blog70

    TII 发布 Falcon3 系列开源大语言模型

    Technology Innovation Institute (TII) 发布了 Falcon3 系列开源大语言模型,包含 1B、3B、7B、10B 以及 Mamba-7B 五个基础模型版本。

    推荐理由:原文详细列出了Falcon3系列各尺寸模型的基准测试得分及训练创新点,读者可据此评估其在小参数规模下的性能表现与开源许可适用性。

  2. Hugging Face Blog34

    Hugging Face 在 GCP 第 5 代 Xeon CPU 上基准测试语言模型性能

    Hugging Face 在 Google Cloud C4(第 5 代 Xeon)与 N2(第 3 代 Xeon)实例上对比文本嵌入和生成性能。C4 的文本嵌入吞吐量比 N2 高 10x 至 24x,文本生成高 2.3x 至 3.6x。考虑价格因素后,C4 在两项任务中分别保持 7x~19x 和 1.7x~2.9x 的 TCO 优势,证明轻量级 Agentic AI 可完全部署于 CPU。

12月16日周一
12月13日周五
12月10日周二
12月9日周一
  1. OpenAI News82

    OpenAI 发布 Sora 文本生成视频模型

    OpenAI 正式推出 Sora,这是一款能够根据文本提示词生成长达一分钟视频的 AI 模型。该模型能准确理解用户的指令并呈现复杂的场景、角色和多镜头叙事。Sora 目前向部分测试用户开放,旨在展示其在模拟物理世界方面的能力。

    推荐理由:官方直接宣布新模型上线,提供了最权威的能力定义和访问入口信息。

  2. OpenAI News20

    OpenAI Sora 系统卡

    OpenAI 发布视频生成模型 Sora 的系统卡。Sora 支持文本、图像及视频输入,能生成全新视频,其设计基于 DALL-E 和 GPT 模型的经验,旨在为用户提供扩展的故事讲述与创意表达工具。