NuminaMath 详解 AIMO 首届进步奖夺冠方案:两阶段微调与工具集成推理
Numina 与 Hugging Face 联合团队凭借 NuminaMath 7B TIR 模型赢得首届 AI 数学奥林匹克(AIMO)进步奖,在私有测试集上解出 29/50 道题。
Numina 与 Hugging Face 联合团队凭借 NuminaMath 7B TIR 模型赢得首届 AI 数学奥林匹克(AIMO)进步奖,在私有测试集上解出 29/50 道题。
Hugging Face 推出 KerasHub 与 Transformers 的共享模型保存格式,允许 KerasHub 直接加载 Hub 上超 30 万个基于 Transformers 的模型。该集成初期支持 Gemma、Llama 3 和 PaliGemma,用户可通过单行代码在 TensorFlow、JAX 或 PyTorch 后端间无缝切换并微调上传。
Google 发布了最新一代开源大语言模型 Gemma 2,包含 9B 和 27B 两种参数规模的基座与指令微调版本。该模型引入了滑动窗口注意力、Logit 软封顶、知识蒸馏和模型合并等四项主要技术进步,上下文长度为 8K tokens。Hugging Face 已同步提供 Transformers 集成、Inference Endpoints 部署支持以及基于 TRL 的微调示例代码。
推荐理由:原文详细解析了Gemma 2在滑动窗口注意力、软封顶及知识蒸馏上的技术改进,并提供了基于Transformers的微调与部署指南。
Hugging Face 联合 Argilla 发布“Data Is Better Together”计划阶段性成果,推出含 10K 提示词的 DIBT/10k_prompts_ranked 数据集及多语言评估项目 MPEP。该社区协作已吸引超 385 人参与,支持 SPIN 等模型训练,并提供 DPO、KTO 等数据集构建指南以推动开源数据生态发展。
Mistral AI 推出其首个专为代码生成设计的开放权重模型 Codestral。该模型参数量为 22B,支持 80 多种编程语言,拥有 32k 上下文窗口,并在 RepoBench 等长程代码生成评测中表现优于竞品。
推荐理由:官方详细披露了 Codestral 的架构参数、多语言支持及基准测试数据,并明确了非生产许可与商业授权路径,为开发者评估其实际编码能力提供了完整依据。
Mistral AI 正式推出 Mistral AI 非生产许可证(MNPL),允许开发者将技术用于非商业目的及支持研究工作。该举措旨在平衡开源理念与商业可持续性,确保基于其模型构建业务的企业能公平贡献于公司的研发与独立发展。
推荐理由:Mistral AI 官方宣布推出非生产许可证 MNPL,明确了其模型在商业与非商业用途下的授权边界。
TII 发布 Falcon 2 系列新模型,包含 11B 参数的基础大语言模型(LLM)和支持图像理解的视觉语言模型(VLM)。
推荐理由:原文给出了11B参数模型的训练数据规模、架构细节及在英语和多语言基准上的具体评测分数,读者可据此评估其性能与开源可用性。
Hugging Face 与 Dell 联合发布 Dell Enterprise Hub,将开源大语言模型的本地训练与部署时间从数周缩短至几分钟。该中心提供 Llama 3、Mixtral 和 Gemma 等模型,支持通过脚本自动部署为 API 端点,并兼容 OpenAI Messages API。
谷歌推出开源视觉语言模型家族 PaliGemma,采用 SigLIP-So400m 作为图像编码器、Gemma-2B 作为文本解码器。该模型支持图像与文本输入并输出文本,提供预训练(PT)、混合任务微调(Mix)及特定基准微调(FT)三类检查点,涵盖 224x224、448x448、896x896 三种分辨率及多种精度格式。
推荐理由:原文详细拆解了PaliGemma的架构组成与推理流程,并提供了基于Transformers的微调代码示例,适合开发者快速上手该开源视觉语言模型。
Hugging Face 发布 Transformers Agents 2.0,引入基于过去观察迭代解决复杂任务的新智能体类型,并将该模块升级为独立库 smolagents。新框架强调代码清晰性与模块化,支持社区共享选项,实测显示基于 Llama-3-70B-Instruct 的智能体在 GAIA Leaderboard 上超越了多个 GPT-4 基线智能体。
推荐理由:官方展示了新框架在GAIA基准测试中超越GPT-4智能体的实测数据,并提供了从Transformers迁移到独立库smolagents的清晰路径。
Hugging Face 现允许用户通过 AWS Marketplace 将组织升级为 Enterprise Hub。该高级订阅提供单点登录、GDPR 合规存储区域及 NVIDIA DGX Cloud 训练等安全与协作功能。升级后计费直接由 AWS 账户管理,价格与公开定价一致。
Meta 正式发布 Llama 3 系列开源大语言模型,包含 8B 和 70B 两种参数规模,均提供基础版和指令微调版。该模型采用新 tokenizer 将词汇表扩展至 128,256,并在超过 15 万亿 tokens 的数据上进行了预训练。
推荐理由:原文详细列出了 Llama 3 的模型规格、训练数据量及在 Hugging Face 生态中的集成方式,为开发者提供了从本地部署到云端推理的具体技术路径。
Mistral AI 发布最新开源模型 Mixtral 8x22B,采用稀疏混合专家(SMoE)架构,总参数 141B 但仅激活 39B。该模型支持英法意德西五种语言,具备函数调用能力,拥有 64K tokens 上下文窗口,并以最宽松的 Apache 2.0 许可证发布。在 MMLU、HumanEval 等基准测试中,其性能超越其他开源权重模型,且推理速度优于任何稠密 70B 模型。
推荐理由:官方详细披露了 Mixtral 8x22B 的稀疏激活参数、多语言基准表现及 Apache 2.0 许可,为评估其成本效率与开源价值提供了一手数据。
Hugging Face 正式发布 Idefics2,这是一个拥有8B参数的通用多模态模型,支持文本与图像混合输入及生成。该模型采用 Apache 2.0 许可证开源,显著增强了 OCR 能力,并在 Visual Question Answering 等基准测试中表现优于同尺寸模型,甚至可与 LLava-Next-34B 等更大模型竞争。
推荐理由:Idefics2 以8B参数和Apache 2.0协议开源,在视觉问答基准上表现优异并简化了微调流程,为社区提供了强大的多模态基础。
Hugging Face 联合 Google Cloud 发布“Deploy on Google Cloud”集成,允许开发者通过 Vertex AI 或 GKE 将数千个基础模型部署为 API Endpoint。
Google 发布 CodeGemma 系列开源代码大模型,包含 2B 基础版、7B 基础版和 7B 指令微调版,均基于 Gemma 架构并额外使用 5000 亿 token 进行训练。
推荐理由:原文给出了 CodeGemma 三个版本的训练数据、上下文长度及在 HumanEval 等基准上的表现,读者可据此评估其在代码补全和对话场景中的实际能力。
MotherDuck 与 Numbers Station 推出专为 DuckDB SQL 设计的 LLM 模型 DuckDB-NSQL-7B,基于 Meta Llama-2-7b 微调。
Hugging Face 发布面向非技术人员的 Transformers 库入门指南,旨在降低开源机器学习门槛。教程演示如何在 Hugging Face Spaces 中利用 NVIDIA A10G GPU(24GB)运行 Microsoft Phi-2 LLM。
Hugging Face 推出 WebSight-v0.2 合成数据集,规模扩至 200 万对截图/HTML 样本并采用 Tailwind CSS。基于该数据微调的 Sightseer 视觉语言模型可将网页截图转换为功能完整的 HTML 代码,支持嵌入相似图像。
Argilla 与 Hugging Face 推出“Data is Better Together”实验,利用 Argilla 和 Hugging Face Spaces 实现社区协作构建数据集。
Hugging Face 演示如何利用 Optimum Habana v1.10.4 和自定义流水线类,在 Intel Gaudi 2 AI 加速器上高效运行 Llama 2(7b/13b/70b)模型。
BigCode 团队发布新一代开源代码大模型 StarCoder2 及其训练数据集 The Stack v2,并开放所有模型权重、数据处理和训练代码。StarCoder2 包含 3B、7B 和 15B 三种参数规模,其中旗舰版 StarCoder2-15B 基于 600 多种编程语言和超过 4 万亿 token 训练,性能在同类尺寸中领先并可媲美 33B+ 模型。
推荐理由:原文公开了 StarCoder2 系列模型的参数规模、训练数据细节及代码权重,为开发者提供了透明可复现的开源代码大模型选择。
Hugging Face 发布指南,演示如何使用 Transformers 和 PEFT 库对 Google DeepMind 的 Gemma 2B/7B 开源权重模型进行参数高效微调。教程重点介绍低秩适应(LoRA)及量化版 QLoRA 技术,支持在 GPU 和 Cloud TPU 上通过 PyTorch/XLA 实现低成本适配。
Hugging Face 宣布全面支持 Google 发布的开源大模型 Gemma,提供 Transformers 集成及云端部署方案。Gemma 包含 2B 和 7B 参数版本,支持消费级 GPU 运行,并给出了基于 TRL 的单卡微调示例。
推荐理由:原文详细说明了 Gemma 在 Hugging Face 生态中的集成方式、硬件适配性及微调流程,为开发者提供了从部署到训练的具体技术路径。
Upstage 于2023年9月发起 Open Ko-LLM Leaderboard,旨在建立透明、公平的韩语大模型评估生态。该平台采用 Ko-MMLU 等五项私有测试集以防止数据污染,上线五个月即收录超1,000个模型。KT 的 Mi:dm 7B 在7B参数以下模型中排名第一并开放使用,SOLAR 及基于 LLaMA2、Yi、Mistral 微调的模型表现强劲。
Hugging Face 在 PEFT 库中发布了针对 LoRA 适配器的新合并方法,支持 cat、linear、svd、ties、dare 和 magnitude_prune 等算法。
推荐理由:原文详解了PEFT新增的多种LoRA适配器合并算法及代码示例,提供了从文本到图像生成的具体实践指南与参数调优建议。
AMD 与 Hugging Face 联合推出 Pervasive AI Developer Contest,提供 Generative AI、Robotics AI 和 PC AI 三个赛道,总奖金达 $160,000 USD。
Hugging Face 在 Text Generation Inference (TGI) v1.4.0 中推出 Messages API,提供与 OpenAI Chat Completion API 的兼容性,允许用户从 OpenAI 模型无缝迁移到开源 LLM。
推荐理由:TGI 1.4.0 新增兼容 OpenAI Chat Completion API 的 Messages API,支持通过修改 base_url 无缝切换至开源模型,并兼容 LangChain 和 LlamaIndex。
Hugging Face 宣布与 Google Cloud 建立战略合作,旨在通过开源模型和云技术赋能企业构建自有 AI。双方将在开放科学、开源工具及云端硬件领域深化协作,支持用户在 GKE 和 Vertex AI 中训练部署模型。该合作将整合 TPU、NVIDIA H100 GPU 等算力资源,并优化 Inference Endpoints 与 Spaces 的使用体验。
Hugging Face 演示如何使用 🤗 Transformers 微调 Wav2Vec2-BERT(580M 参数)以优化低资源自动语音识别。该模型在蒙古语数据集上达到与 Whisper-large-v3 相似的词错误率,但推理速度快 10-30 倍且资源效率提升 2.5 倍。
Hugging Face 发布了名为 aMUSEd 的高效非扩散文本到图像模型,这是 Google MUSE 的开源复现版本。该模型采用掩码图像建模方法,参数量仅约 800M,支持零样本图像修复,并已在 diffusers 库中集成。用户可通过 LoRA 在 7GB 显存下完成微调,模型遵循 OpenRAIL 许可证允许商业使用。
推荐理由:原文给出了基于掩码建模的非扩散架构细节及低显存微调方案,读者可据此评估其在推理效率与端侧部署上的实际潜力。
Hugging Face 发布 2023 年开源 LLM 年度回顾,指出该领域已从单纯追求参数规模转向数据质量竞争。文中重点分析了 BLOOM(176B 参数、46 种语言)和 OPT(175B 参数)等代表性模型的技术架构与训练细节。文章强调开源权重通过支持微调与复用,显著降低了 AI 研发的计算成本与环境足迹。
Mistral AI 发布高质量稀疏混合专家模型(SMoE)Mixtral 8x7B,采用 Apache 2.0 许可开放权重。该模型在大多数基准测试中超越 Llama 2 70B,推理速度提升 6 倍,并在标准基准上匹配或超过 GPT3.5。
推荐理由:官方详细披露了 Mixtral 8x7B 的稀疏专家架构、性能基准及多语言能力,为开发者评估其成本效益和部署可行性提供了核心依据。
Hugging Face 正式支持 Mistral 发布的 Mixtral 8x7b 模型,该模型采用 Mixture of Experts (MoE) 架构,在多个基准测试中超越 GPT-3.5 并创下开源模型新纪录。
推荐理由:原文详细说明了 Mixtral 在 Hugging Face 生态中的集成方式、推理部署选项及微调示例,为开发者提供了从模型获取到生产环境落地的完整技术路径。
Intel Labs 与 Hugging Face 联合发布 SetFitABSA,一种用于少样本训练领域特定 ABSA 模型的框架。该技术在少样本场景下表现优异,甚至超越 Llama2 和 T5 等生成式模型。SetFitABSA 无需手工提示词且训练快速,仅需少量标注样本即可通过生成丰富嵌入向量实现高效情感分析。
Hugging Face 发现 Open LLM Leaderboard 中多数模型在 DROP 基准的 f1-score 低于 10,主要源于归一化逻辑缺陷及生成停止符设置不当。具体表现为数字后接非空格字符导致匹配失败,以及使用句号作为停止符截断浮点数答案或引发长文本冗余。团队提出改用换行符作为结束标记以修正评分偏差。
Hugging Face 推出 Latent Consistency Models (LCM) LoRAs,允许在 Stable Diffusion XL 和 SD v1.5 等模型上通过仅 4-8 步推理实现高质量图像生成,显著加速过程(如 M1 Mac 上从约 60 秒降至 6 秒)。
推荐理由:提供了将LCM LoRA应用于SDXL等模型的具体代码与基准测试,展示了如何在保持画质的前提下大幅降低推理步数并提升生成速度。
Explosion 推出 Prodigy-HF 插件,实现 Prodigy 标注工具与 Hugging Face 生态的直接集成。该插件支持通过 `hf.train.ner` 等命令微调任意 Transformer 模型(如 distilbert-base-uncased),并允许将标注数据集上传至 Hugging Face Hub。
Hugging Face 在 tokenizers 中引入 chat_template 属性,允许使用 Jinja 模板保存和加载模型训练时的聊天格式。该功能旨在解决不同模型采用各异的消息转换格式导致输入分布偏移、进而引发严重且难以调试的性能下降问题。开发者可通过 tokenizer.apply_chat_template() 方法自动格式化对话历史,确保推理或微调时的输入与训练数据一致。
推荐理由:原文提供了将聊天格式作为Jinja模板存入tokenizer的方法,有助于开发者规避因格式不匹配导致的模型性能静默下降。
Hugging Face 推出教程,指导非技术人员利用 AutoTrain、Spaces 和 ChatUI 零代码微调 LLaMA 2 并部署聊天应用。该方案基于 Meta 的 Llama 2 7b 基础模型,通过开源指令数据集进行微调,最终生成可分享的对话界面,旨在降低大语言模型的使用门槛。