跳到正文

#开源生态

今日 0 条
1月31日周五
  1. Hugging Face Blog28

    Hugging Face 发布 AI 艺术工具通讯首期:回顾 2024 Flux.1 等开源模型里程碑

    Hugging Face 推出《AI tools for Art Newsletter》首期,回顾 2024 年图像与视频生成领域的关键突破。文章指出 Flux.1 在多项基准测试中超越 Midjourney v6.0 和 DALL·E 3,成为开源图像生成的新 SOTA。此外,InstantID 等免训练个性化技术显著提升了基于 SDXL 的零样本肖像生成质量。

1月30日周四
  1. Mistral AI82

    Mistral AI 发布 Mistral Small 3:24B 参数 Apache 2.0 开源模型

    Mistral AI 发布 Mistral Small 3,这是一款基于 Apache 2.0 许可证的 24B 参数低延迟优化模型。该模型在 MMLU 上准确率超过 81%,推理速度达 150 tokens/s,比同硬件上的 Llama 3.3 70B 快 3 倍以上。

    推荐理由:原文给出了24B参数模型的Apache 2.0许可、3倍于竞品的推理速度及本地部署门槛,读者可据此评估其在低延迟场景下的替代价值。

1月27日周一
  1. Hugging Face Blog65

    Diffusers 团队解析开源视频生成模型现状及低显存推理优化指南

    Hugging Face Diffusers 团队发布博客,综述了当前开源视频生成模型(如 CogVideoX, Hunyuan, LTX-Video)的能力、局限性及技术架构。

    推荐理由:文章梳理了开源视频生成模型的现状与局限,并提供了在 Diffusers 中通过量化、卸载等优化手段降低显存需求及微调的具体代码方案。

1月16日周四
12月31日周二
  1. Hugging Face Blog82

    Hugging Face 发布 smolagents:支持代码动作的轻量级智能体库

    Hugging Face 推出 smolagents,这是一个旨在简化语言模型智能体能力的轻量级库。其核心特性是 CodeAgent,允许智能体以 Python 代码形式编写动作,相比传统的 JSON 工具调用具有更好的组合性和通用性,并支持通过 E2B 进行沙箱安全执行。

    推荐理由:该库通过让智能体直接编写代码而非JSON来执行动作,并提供了沙箱执行与Hub集成,为构建灵活且安全的AI工作流提供了新的工程范式。

12月18日周三
  1. Hugging Face Blog68

    IBM 等机构发布 Bamba-9B 混合 Mamba2 模型

    IBM、普林斯顿大学、卡内基梅隆大学和伊利诺伊大学香槟分校联合推出 Bamba-9B,这是一款完全使用开放数据训练的混合 Mamba2 模型。在 vLLM 框架下,该模型相比标准 Transformer 实现了 2.5 倍吞吐量提升和 2 倍延迟加速。目前模型已支持 transformers、vLLM、TRL 和 llama.cpp,并公开了包含有状态数据加载器在内的训练与微调配方。

    推荐理由:IBM 联合高校发布基于开放数据训练的混合 Mamba2 模型,提供显著推理效率提升及完整训练复现资源。

12月5日周四
  1. Hugging Face Blog78

    Hugging Face 介绍 Google 发布的 PaliGemma 2 视觉语言模型

    Hugging Face 博客介绍了 Google 新发布的 PaliGemma 2 视觉语言模型,该模型结合了 SigLIP 图像编码器与 Gemma 2 语言模型,提供 3B、10B 和 28B 三种参数规模,并支持 224x224、448x448 和 896x896 多种输入分辨率。

    推荐理由:原文给出了PaliGemma 2的多尺寸变体、分辨率支持及量化性能数据,读者可据此评估其在不同算力条件下的微调潜力与部署成本。

12月3日周二
12月2日周一
11月26日周二
  1. Hugging Face Blog68

    Hugging Face 发布 SmolVLM 2B 视觉语言模型

    Hugging Face 发布 SmolVLM,这是一款参数量为 2B 的视觉语言模型,在 transformers 库中实现了最低的显存占用(约 5.02 GB)。

    推荐理由:SmolVLM 在保持视觉问答能力的同时将显存占用降至约 5GB,为端侧部署和低成本微调提供了具体的性能基准与开源训练配方。

  2. Hugging Face Blog42

    Hugging Face 重构上传下载架构引入内容寻址存储

    Hugging Face Xet 团队重新设计 Hub 上传下载架构,引入内容寻址存储(CAS)以突破现有限制。新协议采用“智能写入、简单读取”理念,在字节级分析文件以优化去重与压缩,预计可将 Safetensors 等张量文件的上传速度提升 10-25%。该方案旨在解决大模型权重传输瓶颈,并为全球用户提供更低延迟和更安全的审计追踪。

11月20日周三
11月18日周一
  1. Mistral AI80

    Mistral AI 发布 Pixtral Large 124B 多模态模型

    Mistral AI 发布 Pixtral Large,这是一个基于 Mistral Large 2 构建的 124B 参数开源权重多模态模型。该模型包含 123B 的多模态解码器和 1B 参数的视觉编码器,支持 128K 上下文窗口,能容纳至少 30 张高分辨率图像。

    推荐理由:原文给出了124B参数规模、128K上下文窗口及在MathVista等基准上的具体得分,读者可据此评估其图像理解能力与开源权重可用性。

11月12日周二
11月5日周二
10月1日周二
  1. Hugging Face Blog30

    BenCzechMark 发布:首个全面评估大语言模型捷克语能力的基准

    Hugging Face 推出 BenCzechMark,这是首个全面评估大语言模型(LLM)捷克语能力的基准套件。该评测涵盖推理、语法生成及知识提取等9个类别共50项任务,其中90%为原生非翻译内容。目前排行榜已收录超过25个不同规模的开源模型,旨在测试模型在捷克语境下的真实表现。

9月17日周二
  1. Mistral AI82

    Mistral AI 发布原生多模态模型 Pixtral 12B

    Mistral AI 发布原生多模态模型 Pixtral 12B,采用 Apache 2.0 许可证开源。该模型基于 Mistral Nemo 架构,支持 128k token 长上下文和可变图像尺寸,在 MMMU 基准测试中达到 52.5%,旨在作为 Mistral Nemo 12B 的直接替代品,兼顾多模态理解与文本指令遵循能力。

    推荐理由:官方发布了原生多模态模型 Pixtral 12B,在保持文本性能的同时提升了视觉推理能力,并提供了多种部署方式。

9月13日周五
8月22日周四
  1. Hugging Face Blog48

    Hugging Face 五大被低估工具详解

    Hugging Face Hub 推出 ZeroGPU、多进程 Docker、Gradio API、Webhooks 和 Nomic Atlas 五项功能,助力构建 AI 解决方案。ZeroGPU 基于 Nvidia A100 提供免费 GPU 配额,Nomic Atlas 支持语义搜索可视化。这些工具通过 Reddit 数据源案例演示了如何低成本实现自动更新的语义搜索应用。

8月13日周二
  1. Hugging Face Blog45

    ggml 入门指南:轻量级 Transformer 推理库核心概念与编译

    ggml 是一个专注于 Transformer 推理的开源 C/C++ 机器学习库,被 llama.cpp、Ollama 等项目用于实现端侧 LLM。其核心优势在于极简主义(少于 5 个文件)、轻量级(二进制小于 1MB)及支持 x86_64、ARM、Apple Silicon 等多硬件后端。开发者需理解 ggml_context、ggml_cgraph 等底层概念以进行高效计算图调度与内存管理。

8月12日周一
7月31日周三
7月23日周二
  1. Hugging Face Blog95

    Hugging Face 上线 Llama 3.1 405B/70B/8B 模型及全栈集成指南

    Hugging Face 正式上架 Meta 发布的 Llama 3.1 系列模型,包含 8B、70B 和 405B 三种尺寸的基座与指令微调版本,以及 Llama Guard 3 和 Prompt Guard 安全模型。

    推荐理由:原文详细列出了 Llama 3.1 各尺寸模型的显存需求、量化方案及微调代码,为开发者评估部署成本和集成路径提供了具体参考。

7月18日周四
  1. Mistral AI82

    Mistral AI 发布与 NVIDIA 合作的 12B 参数模型 Mistral NeMo

    Mistral AI 发布 Mistral NeMo,这是一款与 NVIDIA 合作开发的 12B 参数模型,拥有高达 128k tokens 的上下文窗口。该模型在推理、世界知识和编码准确性方面在其尺寸类别中处于领先地位,并作为 Mistral 7B 的即插即用替代品提供预训练基座和指令微调检查点,采用 Apache 2.0 许可证。

    推荐理由:Mistral NeMo 作为 Mistral 7B 的即插即用替代方案,提供了 128k 上下文窗口和 Apache 2.0 许可,适合需要多语言支持和高效代码压缩的研究者与开发者。

7月16日周二
  1. Mistral AI62

    Mistral AI 发布 Codestral Mamba:基于 Mamba 架构的代码模型

    Mistral AI 发布了 Codestral Mamba,这是继 Mixtral 系列后探索新架构的又一成果。该模型由 Albert Gu 和 Tri Dao 协助设计,利用 Mamba 架构实现线性时间推理和无限长度序列建模的理论能力。

    推荐理由:Mistral AI 发布了基于 Mamba 架构的 Codestral Mamba,该模型在代码生成和推理能力上可与 SOTA Transformer 模型媲美,且支持线性时间推理。

7月11日周四
7月10日周三
6月27日周四
  1. Hugging Face Blog86

    Google 发布 Gemma 2 开源大语言模型

    Google 发布了最新一代开源大语言模型 Gemma 2,包含 9B 和 27B 两种参数规模的基座与指令微调版本。该模型引入了滑动窗口注意力、Logit 软封顶、知识蒸馏和模型合并等四项主要技术进步,上下文长度为 8K tokens。Hugging Face 已同步提供 Transformers 集成、Inference Endpoints 部署支持以及基于 TRL 的微调示例代码。

    推荐理由:原文详细解析了Gemma 2在滑动窗口注意力、软封顶及知识蒸馏上的技术改进,并提供了基于Transformers的微调与部署指南。

6月20日周四
5月29日周三
  1. Mistral AI83

    Mistral AI 发布首个代码生成模型 Codestral

    Mistral AI 推出其首个专为代码生成设计的开放权重模型 Codestral。该模型参数量为 22B,支持 80 多种编程语言,拥有 32k 上下文窗口,并在 RepoBench 等长程代码生成评测中表现优于竞品。

    推荐理由:官方详细披露了 Codestral 的架构参数、多语言支持及基准测试数据,并明确了非生产许可与商业授权路径,为开发者评估其实际编码能力提供了完整依据。

  2. Mistral AI60

    Mistral AI 发布非生产许可证 MNPL

    Mistral AI 正式推出 Mistral AI 非生产许可证(MNPL),允许开发者将技术用于非商业目的及支持研究工作。该举措旨在平衡开源理念与商业可持续性,确保基于其模型构建业务的企业能公平贡献于公司的研发与独立发展。

    推荐理由:Mistral AI 官方宣布推出非生产许可证 MNPL,明确了其模型在商业与非商业用途下的授权边界。

5月24日周五
  1. Hugging Face Blog68

    TII 发布 Falcon 2 11B LLM 和 VLM 模型

    TII 发布 Falcon 2 系列新模型,包含 11B 参数的基础大语言模型(LLM)和支持图像理解的视觉语言模型(VLM)。

    推荐理由:原文给出了11B参数模型的训练数据规模、架构细节及在英语和多语言基准上的具体评测分数,读者可据此评估其性能与开源可用性。

5月21日周二
5月14日周二
  1. Hugging Face Blog82

    谷歌发布开源视觉语言模型 PaliGemma

    谷歌推出开源视觉语言模型家族 PaliGemma,采用 SigLIP-So400m 作为图像编码器、Gemma-2B 作为文本解码器。该模型支持图像与文本输入并输出文本,提供预训练(PT)、混合任务微调(Mix)及特定基准微调(FT)三类检查点,涵盖 224x224、448x448、896x896 三种分辨率及多种精度格式。

    推荐理由:原文详细拆解了PaliGemma的架构组成与推理流程,并提供了基于Transformers的微调代码示例,适合开发者快速上手该开源视觉语言模型。

5月13日周一
  1. Hugging Face Blog75

    Hugging Face 发布 Transformers Agents 2.0 及独立库 smolagents

    Hugging Face 发布 Transformers Agents 2.0,引入基于过去观察迭代解决复杂任务的新智能体类型,并将该模块升级为独立库 smolagents。新框架强调代码清晰性与模块化,支持社区共享选项,实测显示基于 Llama-3-70B-Instruct 的智能体在 GAIA Leaderboard 上超越了多个 GPT-4 基线智能体。

    推荐理由:官方展示了新框架在GAIA基准测试中超越GPT-4智能体的实测数据,并提供了从Transformers迁移到独立库smolagents的清晰路径。

5月9日周四
4月18日周四
  1. Hugging Face Blog92

    Meta 发布 Llama 3 开源大语言模型

    Meta 正式发布 Llama 3 系列开源大语言模型,包含 8B 和 70B 两种参数规模,均提供基础版和指令微调版。该模型采用新 tokenizer 将词汇表扩展至 128,256,并在超过 15 万亿 tokens 的数据上进行了预训练。

    推荐理由:原文详细列出了 Llama 3 的模型规格、训练数据量及在 Hugging Face 生态中的集成方式,为开发者提供了从本地部署到云端推理的具体技术路径。

4月17日周三
  1. Mistral AI82

    Mistral AI 发布开源大模型 Mixtral 8x22B

    Mistral AI 发布最新开源模型 Mixtral 8x22B,采用稀疏混合专家(SMoE)架构,总参数 141B 但仅激活 39B。该模型支持英法意德西五种语言,具备函数调用能力,拥有 64K tokens 上下文窗口,并以最宽松的 Apache 2.0 许可证发布。在 MMLU、HumanEval 等基准测试中,其性能超越其他开源权重模型,且推理速度优于任何稠密 70B 模型。

    推荐理由:官方详细披露了 Mixtral 8x22B 的稀疏激活参数、多语言基准表现及 Apache 2.0 许可,为评估其成本效率与开源价值提供了一手数据。