跳到正文

#开源生态

今日 0 条
7月11日周四
7月10日周三
6月27日周四
  1. Hugging Face Blog86

    Google 发布 Gemma 2 开源大语言模型

    Google 发布了最新一代开源大语言模型 Gemma 2,包含 9B 和 27B 两种参数规模的基座与指令微调版本。该模型引入了滑动窗口注意力、Logit 软封顶、知识蒸馏和模型合并等四项主要技术进步,上下文长度为 8K tokens。Hugging Face 已同步提供 Transformers 集成、Inference Endpoints 部署支持以及基于 TRL 的微调示例代码。

    推荐理由:原文详细解析了Gemma 2在滑动窗口注意力、软封顶及知识蒸馏上的技术改进,并提供了基于Transformers的微调与部署指南。

6月20日周四
5月29日周三
  1. Mistral AI83

    Mistral AI 发布首个代码生成模型 Codestral

    Mistral AI 推出其首个专为代码生成设计的开放权重模型 Codestral。该模型参数量为 22B,支持 80 多种编程语言,拥有 32k 上下文窗口,并在 RepoBench 等长程代码生成评测中表现优于竞品。

    推荐理由:官方详细披露了 Codestral 的架构参数、多语言支持及基准测试数据,并明确了非生产许可与商业授权路径,为开发者评估其实际编码能力提供了完整依据。

  2. Mistral AI60

    Mistral AI 发布非生产许可证 MNPL

    Mistral AI 正式推出 Mistral AI 非生产许可证(MNPL),允许开发者将技术用于非商业目的及支持研究工作。该举措旨在平衡开源理念与商业可持续性,确保基于其模型构建业务的企业能公平贡献于公司的研发与独立发展。

    推荐理由:Mistral AI 官方宣布推出非生产许可证 MNPL,明确了其模型在商业与非商业用途下的授权边界。

5月24日周五
  1. Hugging Face Blog68

    TII 发布 Falcon 2 11B LLM 和 VLM 模型

    TII 发布 Falcon 2 系列新模型,包含 11B 参数的基础大语言模型(LLM)和支持图像理解的视觉语言模型(VLM)。

    推荐理由:原文给出了11B参数模型的训练数据规模、架构细节及在英语和多语言基准上的具体评测分数,读者可据此评估其性能与开源可用性。

5月21日周二
5月14日周二
  1. Hugging Face Blog82

    谷歌发布开源视觉语言模型 PaliGemma

    谷歌推出开源视觉语言模型家族 PaliGemma,采用 SigLIP-So400m 作为图像编码器、Gemma-2B 作为文本解码器。该模型支持图像与文本输入并输出文本,提供预训练(PT)、混合任务微调(Mix)及特定基准微调(FT)三类检查点,涵盖 224x224、448x448、896x896 三种分辨率及多种精度格式。

    推荐理由:原文详细拆解了PaliGemma的架构组成与推理流程,并提供了基于Transformers的微调代码示例,适合开发者快速上手该开源视觉语言模型。

5月13日周一
  1. Hugging Face Blog75

    Hugging Face 发布 Transformers Agents 2.0 及独立库 smolagents

    Hugging Face 发布 Transformers Agents 2.0,引入基于过去观察迭代解决复杂任务的新智能体类型,并将该模块升级为独立库 smolagents。新框架强调代码清晰性与模块化,支持社区共享选项,实测显示基于 Llama-3-70B-Instruct 的智能体在 GAIA Leaderboard 上超越了多个 GPT-4 基线智能体。

    推荐理由:官方展示了新框架在GAIA基准测试中超越GPT-4智能体的实测数据,并提供了从Transformers迁移到独立库smolagents的清晰路径。

5月9日周四
4月18日周四
  1. Hugging Face Blog92

    Meta 发布 Llama 3 开源大语言模型

    Meta 正式发布 Llama 3 系列开源大语言模型,包含 8B 和 70B 两种参数规模,均提供基础版和指令微调版。该模型采用新 tokenizer 将词汇表扩展至 128,256,并在超过 15 万亿 tokens 的数据上进行了预训练。

    推荐理由:原文详细列出了 Llama 3 的模型规格、训练数据量及在 Hugging Face 生态中的集成方式,为开发者提供了从本地部署到云端推理的具体技术路径。

4月17日周三
  1. Mistral AI82

    Mistral AI 发布开源大模型 Mixtral 8x22B

    Mistral AI 发布最新开源模型 Mixtral 8x22B,采用稀疏混合专家(SMoE)架构,总参数 141B 但仅激活 39B。该模型支持英法意德西五种语言,具备函数调用能力,拥有 64K tokens 上下文窗口,并以最宽松的 Apache 2.0 许可证发布。在 MMLU、HumanEval 等基准测试中,其性能超越其他开源权重模型,且推理速度优于任何稠密 70B 模型。

    推荐理由:官方详细披露了 Mixtral 8x22B 的稀疏激活参数、多语言基准表现及 Apache 2.0 许可,为评估其成本效率与开源价值提供了一手数据。

4月15日周一
  1. Hugging Face Blog70

    Hugging Face 发布 Idefics2:8B 参数开源视觉语言模型

    Hugging Face 正式发布 Idefics2,这是一个拥有8B参数的通用多模态模型,支持文本与图像混合输入及生成。该模型采用 Apache 2.0 许可证开源,显著增强了 OCR 能力,并在 Visual Question Answering 等基准测试中表现优于同尺寸模型,甚至可与 LLava-Next-34B 等更大模型竞争。

    推荐理由:Idefics2 以8B参数和Apache 2.0协议开源,在视觉问答基准上表现优异并简化了微调流程,为社区提供了强大的多模态基础。

4月10日周三
4月9日周二
  1. Hugging Face Blog78

    Google 发布 CodeGemma 系列代码大模型

    Google 发布 CodeGemma 系列开源代码大模型,包含 2B 基础版、7B 基础版和 7B 指令微调版,均基于 Gemma 架构并额外使用 5000 亿 token 进行训练。

    推荐理由:原文给出了 CodeGemma 三个版本的训练数据、上下文长度及在 HumanEval 等基准上的表现,读者可据此评估其在代码补全和对话场景中的实际能力。

4月4日周四
3月22日周五
3月15日周五
3月4日周一
2月29日周四
2月28日周三
  1. Hugging Face Blog82

    BigCode 发布 StarCoder2 系列开源代码大模型及 The Stack v2 数据集

    BigCode 团队发布新一代开源代码大模型 StarCoder2 及其训练数据集 The Stack v2,并开放所有模型权重、数据处理和训练代码。StarCoder2 包含 3B、7B 和 15B 三种参数规模,其中旗舰版 StarCoder2-15B 基于 600 多种编程语言和超过 4 万亿 token 训练,性能在同类尺寸中领先并可媲美 33B+ 模型。

    推荐理由:原文公开了 StarCoder2 系列模型的参数规模、训练数据细节及代码权重,为开发者提供了透明可复现的开源代码大模型选择。

2月23日周五
2月21日周三
  1. Hugging Face Blog86

    Hugging Face 宣布支持 Google 开源大模型 Gemma

    Hugging Face 宣布全面支持 Google 发布的开源大模型 Gemma,提供 Transformers 集成及云端部署方案。Gemma 包含 2B 和 7B 参数版本,支持消费级 GPU 运行,并给出了基于 TRL 的单卡微调示例。

    推荐理由:原文详细说明了 Gemma 在 Hugging Face 生态中的集成方式、硬件适配性及微调流程,为开发者提供了从部署到训练的具体技术路径。

2月20日周二
  1. Hugging Face Blog33

    Upstage 推出 Open Ko-LLM Leaderboard:构建韩语大模型评估生态

    Upstage 于2023年9月发起 Open Ko-LLM Leaderboard,旨在建立透明、公平的韩语大模型评估生态。该平台采用 Ko-MMLU 等五项私有测试集以防止数据污染,上线五个月即收录超1,000个模型。KT 的 Mi:dm 7B 在7B参数以下模型中排名第一并开放使用,SOLAR 及基于 LLaMA2、Yi、Mistral 微调的模型表现强劲。

2月19日周一
2月14日周三
2月8日周四
  1. Hugging Face Blog68

    Hugging Face TGI 发布兼容 OpenAI 的 Messages API

    Hugging Face 在 Text Generation Inference (TGI) v1.4.0 中推出 Messages API,提供与 OpenAI Chat Completion API 的兼容性,允许用户从 OpenAI 模型无缝迁移到开源 LLM。

    推荐理由:TGI 1.4.0 新增兼容 OpenAI Chat Completion API 的 Messages API,支持通过修改 base_url 无缝切换至开源模型,并兼容 LangChain 和 LlamaIndex。

1月25日周四
  1. Hugging Face Blog42

    Hugging Face 与 Google Cloud 达成开放 AI 战略合作

    Hugging Face 宣布与 Google Cloud 建立战略合作,旨在通过开源模型和云技术赋能企业构建自有 AI。双方将在开放科学、开源工具及云端硬件领域深化协作,支持用户在 GKE 和 Vertex AI 中训练部署模型。该合作将整合 TPU、NVIDIA H100 GPU 等算力资源,并优化 Inference Endpoints 与 Spaces 的使用体验。

1月19日周五
1月4日周四
  1. Hugging Face Blog63

    Hugging Face 发布高效非扩散文本到图像模型 aMUSEd

    Hugging Face 发布了名为 aMUSEd 的高效非扩散文本到图像模型,这是 Google MUSE 的开源复现版本。该模型采用掩码图像建模方法,参数量仅约 800M,支持零样本图像修复,并已在 diffusers 库中集成。用户可通过 LoRA 在 7GB 显存下完成微调,模型遵循 OpenRAIL 许可证允许商业使用。

    推荐理由:原文给出了基于掩码建模的非扩散架构细节及低显存微调方案,读者可据此评估其在推理效率与端侧部署上的实际潜力。

12月18日周一
  1. Hugging Face Blog42

    Hugging Face 回顾 2023 年开源大语言模型发展

    Hugging Face 发布 2023 年开源 LLM 年度回顾,指出该领域已从单纯追求参数规模转向数据质量竞争。文中重点分析了 BLOOM(176B 参数、46 种语言)和 OPT(175B 参数)等代表性模型的技术架构与训练细节。文章强调开源权重通过支持微调与复用,显著降低了 AI 研发的计算成本与环境足迹。

12月11日周一
  1. Mistral AI89

    Mistral AI 发布开源混合专家模型 Mixtral 8x7B

    Mistral AI 发布高质量稀疏混合专家模型(SMoE)Mixtral 8x7B,采用 Apache 2.0 许可开放权重。该模型在大多数基准测试中超越 Llama 2 70B,推理速度提升 6 倍,并在标准基准上匹配或超过 GPT3.5。

    推荐理由:官方详细披露了 Mixtral 8x7B 的稀疏专家架构、性能基准及多语言能力,为开发者评估其成本效益和部署可行性提供了核心依据。

  2. Hugging Face Blog87

    Hugging Face 宣布支持 Mistral 发布的 SOTA 混合专家模型 Mixtral

    Hugging Face 正式支持 Mistral 发布的 Mixtral 8x7b 模型,该模型采用 Mixture of Experts (MoE) 架构,在多个基准测试中超越 GPT-3.5 并创下开源模型新纪录。

    推荐理由:原文详细说明了 Mixtral 在 Hugging Face 生态中的集成方式、推理部署选项及微调示例,为开发者提供了从模型获取到生产环境落地的完整技术路径。

12月6日周三
  1. Hugging Face Blog42

    Intel Labs 与 Hugging Face 联合推出 SetFitABSA:少样本基于方面的情感分析框架

    Intel Labs 与 Hugging Face 联合发布 SetFitABSA,一种用于少样本训练领域特定 ABSA 模型的框架。该技术在少样本场景下表现优异,甚至超越 Llama2 和 T5 等生成式模型。SetFitABSA 无需手工提示词且训练快速,仅需少量标注样本即可通过生成丰富嵌入向量实现高效情感分析。

12月1日周五
  1. Hugging Face Blog40

    Hugging Face 深入分析 Open LLM Leaderboard 中 DROP 基准分数异常原因

    Hugging Face 发现 Open LLM Leaderboard 中多数模型在 DROP 基准的 f1-score 低于 10,主要源于归一化逻辑缺陷及生成停止符设置不当。具体表现为数字后接非空格字符导致匹配失败,以及使用句号作为停止符截断浮点数答案或引发长文本冗余。团队提出改用换行符作为结束标记以修正评分偏差。

11月9日周四
  1. Hugging Face Blog85

    Hugging Face 发布 Latent Consistency LoRAs 实现 SDXL 4 步快速生成

    Hugging Face 推出 Latent Consistency Models (LCM) LoRAs,允许在 Stable Diffusion XL 和 SD v1.5 等模型上通过仅 4-8 步推理实现高质量图像生成,显著加速过程(如 M1 Mac 上从约 60 秒降至 6 秒)。

    推荐理由:提供了将LCM LoRA应用于SDXL等模型的具体代码与基准测试,展示了如何在保持画质的前提下大幅降低推理步数并提升生成速度。

11月7日周二
10月3日周二
  1. Hugging Face Blog63

    Hugging Face 推出 Chat Templates 以解决聊天模型格式错配问题

    Hugging Face 在 tokenizers 中引入 chat_template 属性,允许使用 Jinja 模板保存和加载模型训练时的聊天格式。该功能旨在解决不同模型采用各异的消息转换格式导致输入分布偏移、进而引发严重且难以调试的性能下降问题。开发者可通过 tokenizer.apply_chat_template() 方法自动格式化对话历史,确保推理或微调时的输入与训练数据一致。

    推荐理由:原文提供了将聊天格式作为Jinja模板存入tokenizer的方法,有助于开发者规避因格式不匹配导致的模型性能静默下降。

9月28日周四