Meta 发布 Llama 3 开源大语言模型
Meta 正式发布 Llama 3 系列开源大语言模型,包含 8B 和 70B 两种参数规模,均提供基础版和指令微调版。该模型采用新 tokenizer 将词汇表扩展至 128,256,并在超过 15 万亿 tokens 的数据上进行了预训练。
推荐理由:原文详细列出了 Llama 3 的模型规格、训练数据量及在 Hugging Face 生态中的集成方式,为开发者提供了从本地部署到云端推理的具体技术路径。
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
Meta 正式发布 Llama 3 系列开源大语言模型,包含 8B 和 70B 两种参数规模,均提供基础版和指令微调版。该模型采用新 tokenizer 将词汇表扩展至 128,256,并在超过 15 万亿 tokens 的数据上进行了预训练。
推荐理由:原文详细列出了 Llama 3 的模型规格、训练数据量及在 Hugging Face 生态中的集成方式,为开发者提供了从本地部署到云端推理的具体技术路径。
Mistral AI 发布最新开源模型 Mixtral 8x22B,采用稀疏混合专家(SMoE)架构,总参数 141B 但仅激活 39B。该模型支持英法意德西五种语言,具备函数调用能力,拥有 64K tokens 上下文窗口,并以最宽松的 Apache 2.0 许可证发布。在 MMLU、HumanEval 等基准测试中,其性能超越其他开源权重模型,且推理速度优于任何稠密 70B 模型。
推荐理由:官方详细披露了 Mixtral 8x22B 的稀疏激活参数、多语言基准表现及 Apache 2.0 许可,为评估其成本效率与开源价值提供了一手数据。
Hugging Face 正式发布 Idefics2,这是一个拥有8B参数的通用多模态模型,支持文本与图像混合输入及生成。该模型采用 Apache 2.0 许可证开源,显著增强了 OCR 能力,并在 Visual Question Answering 等基准测试中表现优于同尺寸模型,甚至可与 LLava-Next-34B 等更大模型竞争。
推荐理由:Idefics2 以8B参数和Apache 2.0协议开源,在视觉问答基准上表现优异并简化了微调流程,为社区提供了强大的多模态基础。
Google 发布 CodeGemma 系列开源代码大模型,包含 2B 基础版、7B 基础版和 7B 指令微调版,均基于 Gemma 架构并额外使用 5000 亿 token 进行训练。
推荐理由:原文给出了 CodeGemma 三个版本的训练数据、上下文长度及在 HumanEval 等基准上的表现,读者可据此评估其在代码补全和对话场景中的实际能力。
BigCode 团队发布新一代开源代码大模型 StarCoder2 及其训练数据集 The Stack v2,并开放所有模型权重、数据处理和训练代码。StarCoder2 包含 3B、7B 和 15B 三种参数规模,其中旗舰版 StarCoder2-15B 基于 600 多种编程语言和超过 4 万亿 token 训练,性能在同类尺寸中领先并可媲美 33B+ 模型。
推荐理由:原文公开了 StarCoder2 系列模型的参数规模、训练数据细节及代码权重,为开发者提供了透明可复现的开源代码大模型选择。
Hugging Face 宣布全面支持 Google 发布的开源大模型 Gemma,提供 Transformers 集成及云端部署方案。Gemma 包含 2B 和 7B 参数版本,支持消费级 GPU 运行,并给出了基于 TRL 的单卡微调示例。
推荐理由:原文详细说明了 Gemma 在 Hugging Face 生态中的集成方式、硬件适配性及微调流程,为开发者提供了从部署到训练的具体技术路径。
Hugging Face 在 PEFT 库中发布了针对 LoRA 适配器的新合并方法,支持 cat、linear、svd、ties、dare 和 magnitude_prune 等算法。
推荐理由:原文详解了PEFT新增的多种LoRA适配器合并算法及代码示例,提供了从文本到图像生成的具体实践指南与参数调优建议。
Hugging Face 在 Text Generation Inference (TGI) v1.4.0 中推出 Messages API,提供与 OpenAI Chat Completion API 的兼容性,允许用户从 OpenAI 模型无缝迁移到开源 LLM。
推荐理由:TGI 1.4.0 新增兼容 OpenAI Chat Completion API 的 Messages API,支持通过修改 base_url 无缝切换至开源模型,并兼容 LangChain 和 LlamaIndex。
Hugging Face 发布了名为 aMUSEd 的高效非扩散文本到图像模型,这是 Google MUSE 的开源复现版本。该模型采用掩码图像建模方法,参数量仅约 800M,支持零样本图像修复,并已在 diffusers 库中集成。用户可通过 LoRA 在 7GB 显存下完成微调,模型遵循 OpenRAIL 许可证允许商业使用。
推荐理由:原文给出了基于掩码建模的非扩散架构细节及低显存微调方案,读者可据此评估其在推理效率与端侧部署上的实际潜力。
Mistral AI 发布高质量稀疏混合专家模型(SMoE)Mixtral 8x7B,采用 Apache 2.0 许可开放权重。该模型在大多数基准测试中超越 Llama 2 70B,推理速度提升 6 倍,并在标准基准上匹配或超过 GPT3.5。
推荐理由:官方详细披露了 Mixtral 8x7B 的稀疏专家架构、性能基准及多语言能力,为开发者评估其成本效益和部署可行性提供了核心依据。
Hugging Face 正式支持 Mistral 发布的 Mixtral 8x7b 模型,该模型采用 Mixture of Experts (MoE) 架构,在多个基准测试中超越 GPT-3.5 并创下开源模型新纪录。
推荐理由:原文详细说明了 Mixtral 在 Hugging Face 生态中的集成方式、推理部署选项及微调示例,为开发者提供了从模型获取到生产环境落地的完整技术路径。
Hugging Face 推出 Latent Consistency Models (LCM) LoRAs,允许在 Stable Diffusion XL 和 SD v1.5 等模型上通过仅 4-8 步推理实现高质量图像生成,显著加速过程(如 M1 Mac 上从约 60 秒降至 6 秒)。
推荐理由:提供了将LCM LoRA应用于SDXL等模型的具体代码与基准测试,展示了如何在保持画质的前提下大幅降低推理步数并提升生成速度。
Hugging Face 在 tokenizers 中引入 chat_template 属性,允许使用 Jinja 模板保存和加载模型训练时的聊天格式。该功能旨在解决不同模型采用各异的消息转换格式导致输入分布偏移、进而引发严重且难以调试的性能下降问题。开发者可通过 tokenizer.apply_chat_template() 方法自动格式化对话历史,确保推理或微调时的输入与训练数据一致。
推荐理由:原文提供了将聊天格式作为Jinja模板存入tokenizer的方法,有助于开发者规避因格式不匹配导致的模型性能静默下降。
Mistral AI 发布 Mistral 7B,这是一个拥有 7.3B 参数的语言模型,采用 Apache 2.0 许可证完全开源。该模型在所有基准测试中均优于 Llama 2 13B,在许多基准上超过 Llama 1 34B,并使用分组查询注意力(GQA)和滑动窗口注意力(SWA)以加速推理和处理长序列。
推荐理由:原文给出了 Mistral 7B 在多项基准上超越 Llama 2 13B 的实测数据及 Apache 2.0 开源许可,读者可据此评估小参数模型的性价比与部署可行性。
Mistral AI 发布其首个 70 亿参数模型 Mistral 7B,该模型在所有标准英语和代码基准测试中超越了目前可用的所有高达 130 亿参数的开源模型。公司以 Apache 2.0 许可证开源该模型,旨在通过社区驱动的开放权重方法构建对 AI 寡头的可信替代方案。Mistral AI 承诺将持续发布缩小与黑盒模型性能差距的新模型,并同步推进商业专有模型及托管解决方案的开发。
推荐理由:Mistral AI 阐述开放权重模型对抗闭源垄断的理念,并发布首个超越同量级开源模型的 Mistral 7B。
TII 发布的 Falcon 180B 正式登陆 Hugging Face Hub,提供 base 和 chat 版本。该模型拥有 1800 亿参数,基于 RefinedWeb 数据集在 3.5 万亿 tokens 上完成预训练,是当时最大的公开可用语言模型。其性能在多项基准测试中超越 Llama 2 70B,接近 PaLM-2 Large,但商用许可对托管使用有严格限制。
推荐理由:原文给出了 Falcon 180B 的参数量、训练数据规模及硬件需求,读者可据此评估其在开源大模型中的性能定位与部署门槛。
Hugging Face 宣布在生态系统中集成 Meta 发布的 Code Llama 模型系列,提供 transformers 4.33+ 支持、Text Generation Inference 部署及 VS Code 扩展。
推荐理由:原文给出了 Code Llama 在 Hugging Face 生态中的集成方式、不同参数规模的能力差异以及具体的部署与微调建议,读者可以据此判断如何将其接入现有开发工作流。
Hugging Face 推出开源视觉语言模型 IDEFICS,作为 DeepMind Flamingo 的公开复现版本。该模型提供 9B 和 80B 参数两种规模及指令微调变体,支持图文交错输入与文本生成。训练数据包含新创建的 115B token 数据集 OBELICS,模型权重在 Hugging Face Hub 上线并集成至 transformers 库。
推荐理由:原文公开了基于 Flamingo 架构的开源复现细节及 OBELICS 数据集,为社区提供了可验证的多模态大模型训练基准。
Hugging Face 发布 swift-transformers、swift-chat 及更新的模型导出工具,旨在帮助开发者在 Mac 和 iPhone 等苹果设备上通过 Core ML 运行 Llama 2 等大语言模型。
推荐理由:原文提供了在苹果设备上运行大语言模型的完整工具链和转换指南,开发者可据此评估本地化部署的可行性。
Hugging Face 官方博客于2023年7月18日发布了一篇关于模型发布的文章。