Hugging Face 上线 LiveCodeBench 排行榜:无数据污染的代码 LLM 综合评测
Hugging Face 推出基于 LiveCodeBench 的排行榜,该基准由 UC Berkeley、MIT 和 Cornell 开发,通过按发布时间窗口评估防止数据污染。它涵盖代码生成、自我修复、执行及测试输出预测四个场景,使用 Pass@1 指标衡量能力。GPT-4-Turbo 在多数场景表现最佳,Claude-3-Opus 则在测试输出预测中超越前者。
Hugging Face 推出基于 LiveCodeBench 的排行榜,该基准由 UC Berkeley、MIT 和 Cornell 开发,通过按发布时间窗口评估防止数据污染。它涵盖代码生成、自我修复、执行及测试输出预测四个场景,使用 Pass@1 指标衡量能力。GPT-4-Turbo 在多数场景表现最佳,Claude-3-Opus 则在测试输出预测中超越前者。
Ryght 正式发布 Ryght Preview,这是一个面向生命科学领域的企业级生成式 AI SaaS 平台。该团队通过 Hugging Face Expert Support 获得技术咨询,利用 Text Generation Inference (TGI) 和 Text Embeddings Inference (TEI) 构建支持可插拔 LLM 的架构。
Hugging Face 正式发布 Idefics2,这是一个拥有8B参数的通用多模态模型,支持文本与图像混合输入及生成。该模型采用 Apache 2.0 许可证开源,显著增强了 OCR 能力,并在 Visual Question Answering 等基准测试中表现优于同尺寸模型,甚至可与 LLava-Next-34B 等更大模型竞争。
推荐理由:Idefics2 以8B参数和Apache 2.0协议开源,在视觉问答基准上表现优异并简化了微调流程,为社区提供了强大的多模态基础。
Hugging Face 发布指南解析视觉语言模型(VLM)架构,涵盖 LLaVA、Qwen-VL 等开源模型的推理与微调方法。文章介绍利用 Vision Arena 和 Open VLM Leaderboard 进行模型选型,并支持通过 trl 库的新版本实现高效微调。
Hugging Face 联合 Google Cloud 发布“Deploy on Google Cloud”集成,允许开发者通过 Vertex AI 或 GKE 将数千个基础模型部署为 API Endpoint。
Google 发布 CodeGemma 系列开源代码大模型,包含 2B 基础版、7B 基础版和 7B 指令微调版,均基于 Gemma 架构并额外使用 5000 亿 token 进行训练。
推荐理由:原文给出了 CodeGemma 三个版本的训练数据、上下文长度及在 HumanEval 等基准上的表现,读者可据此评估其在代码补全和对话场景中的实际能力。
Hugging Face 宣布与云安全公司 Wiz 合作,集成其漏洞管理和 CSPM 功能以强化平台安全。Wiz 研究人员发现利用 pickle 文件在沙箱执行任意代码的缺陷,Hugging Face 已修复该问题并推广 Safetensors 作为替代方案。
MotherDuck 与 Numbers Station 推出专为 DuckDB SQL 设计的 LLM 模型 DuckDB-NSQL-7B,基于 Meta Llama-2-7b 微调。
Hugging Face 展示如何利用 🤗 Optimum Intel 将 SetFit 模型在 Intel Xeon CPU 上的推理速度提升 7.8 倍。该方案采用静态后训练量化(PTQ),仅需少量无标签校准数据即可降低内存占用并保留精度,无需重新训练。这为基于 Sentence Transformers 的少样本微调框架提供了生产级部署的高效路径。
Hugging Face 与 Cloudflare 合作推出 Deploy on Cloudflare Workers AI 集成,允许开发者通过无服务器 API 调用 Llama、Mistral 等开源模型。
Pollen Robotics 发布开源库 Pollen-Vision,集成 OWL-VIT、Mobile Sam 和 RAM 等零样本模型,实现无需训练的 3D 物体检测。该库支持在消费级 GPU 上实时运行,例如 RTX 3070 处理单提示帧耗时约 75ms,旨在通过提供空间坐标助力机器人抓取未知物体。
Hugging Face 发布面向非技术人员的 Transformers 库入门指南,旨在降低开源机器学习门槛。教程演示如何在 Hugging Face Spaces 中利用 NVIDIA A10G GPU(24GB)运行 Microsoft Phi-2 LLM。
Hugging Face 博客介绍了嵌入向量的二进制和标量(int8)量化方法,旨在解决大规模检索中的内存与成本瓶颈。通过结合二进制快速检索与 int8 重排序,该方法在保持约 96% 原始性能的同时,将内存占用减少 32 倍,检索速度提升最高达 45 倍。文中提供了基于 Sentence Transformers 库的实现代码及针对 4100 万条维基百科文本的演示案例。
推荐理由:原文提供了二进制与标量量化结合重排序的检索方案及代码示例,读者可据此评估其在降低内存成本与提升速度间的平衡效果。
Lighthouz AI 联合 Hugging Face 发布 Chatbot Guardrails Arena,通过社区盲测评估大语言模型及隐私护栏的安全性。
Hugging Face 利用 Optimum Intel 库对 Microsoft Phi-2 模型进行 4-bit 量化,并在搭载 Core Ultra 7 155H CPU 的 Intel Meteor Lake 笔记本上成功运行。该方案结合硬件加速与小语言模型优势,实现了本地低延迟、高隐私的 LLM 推理体验。
Hugging Face 博客介绍了 GaLore 方法,通过利用梯度的低秩结构投影,使在 NVIDIA RTX 4090 等消费级 GPU 上训练高达 70 亿参数的模型成为可能。
推荐理由:原文提供了在消费级硬件上训练大模型的具体实现步骤和代码示例,读者可据此复现低显存优化方案。
Hugging Face 推出 Cosmopedia,这是一个包含超过 3000 万个文件和 250 亿 token 的开源合成数据集,旨在复现 Phi-1.5 的训练数据以用于从零开始预训练大语言模型。
推荐理由:原文详细拆解了从提示词工程到大规模生成的完整技术栈,为复现 Phi 系列合成数据提供了可落地的开源方案。
Hugging Face 推出 Quanto,这是 Optimum 框架下的 PyTorch 量化后端。它支持 int2、int4、int8 和 float8 权重及激活,兼容 CUDA 与 MPS 设备,并集成于 transformers 库中。该工具旨在简化大语言模型及其他模态模型的量化流程,降低部署内存成本。
Hugging Face 联合 NVIDIA 推出 Train on DGX Cloud 服务,允许 Enterprise Hub 用户通过无代码界面在 H100 GPU 上微调 Llama、Mistral 等开源模型。该服务按分钟计费,H100 实例价格为 $8.25/GPU hour,支持 1x 至 8x 配置及 CSV/JSON 数据格式。
Hugging Face 推出 WebSight-v0.2 合成数据集,规模扩至 200 万对截图/HTML 样本并采用 Tailwind CSS。基于该数据微调的 Sightseer 视觉语言模型可将网页截图转换为功能完整的 HTML 代码,支持嵌入相似图像。
Hugging Face 演示如何利用 Optimum Intel 和 fastRAG 在 Xeon CPU 上加速 BGE 嵌入模型。通过量化等技术,该方案显著降低延迟并提升吞吐量,适用于 RAG 管道中的检索与重排序。BGE small、base 和 large 模型分别拥有 45M、110M 和 355M 参数,编码向量维度为 384/768/1024。
UCLA 研究人员推出 ConTextual 数据集,包含 506 个指令,旨在评估大语言模型(LMM)对图像中文本与视觉上下文的联合推理能力。基准测试显示,GPT-4V 等专有模型在信息图和时间读取任务上表现不佳,开源模型如 LLaVA-v1.5-13B 存在显著领域差距。增强型 LLM 方法仅获 17.2% 的人类认可率,表明当前模型在处理文本丰富的真实场景时仍有巨大提升空间。
Argilla 与 Hugging Face 推出“Data is Better Together”实验,利用 Argilla 和 Hugging Face Spaces 实现社区协作构建数据集。
Hugging Face 演示如何利用 Optimum Habana v1.10.4 和自定义流水线类,在 Intel Gaudi 2 AI 加速器上高效运行 Llama 2(7b/13b/70b)模型。
BigCode 团队发布新一代开源代码大模型 StarCoder2 及其训练数据集 The Stack v2,并开放所有模型权重、数据处理和训练代码。StarCoder2 包含 3B、7B 和 15B 三种参数规模,其中旗舰版 StarCoder2-15B 基于 600 多种编程语言和超过 4 万亿 token 训练,性能在同类尺寸中领先并可媲美 33B+ 模型。
推荐理由:原文公开了 StarCoder2 系列模型的参数规模、训练数据细节及代码权重,为开发者提供了透明可复现的开源代码大模型选择。
Hugging Face 发布 TTS Arena,借鉴 Chatbot Arena 模式让用户盲听并投票比较文本转语音模型。该工具收录 ElevenLabs、MetaVoice、OpenVoice 等 SOTA 模型,通过 Elo 算法生成公开排行榜。此举旨在解决 WER 和 MOS 等传统指标在评估语音自然度时的局限性,实现开源与闭源模型的公平对比。
Hugging Face 博客详解 AI 生成内容的水印技术,涵盖生成时嵌入与后处理两种主要方法。文章对比了 Glaze、Nightshade 等数据投毒工具及 Truepic 的 C2PA 签名方案,并分析了开源与闭源水印在防篡改与创新间的权衡。
Hugging Face 发布指南,演示如何使用 Transformers 和 PEFT 库对 Google DeepMind 的 Gemma 2B/7B 开源权重模型进行参数高效微调。教程重点介绍低秩适应(LoRA)及量化版 QLoRA 技术,支持在 GPU 和 Cloud TPU 上通过 PyTorch/XLA 实现低成本适配。
Haize Labs 联合 Hugging Face 发布 Red-Teaming Resistance Benchmark,旨在通过高质量的人类对抗提示词测试前沿大语言模型的鲁棒性。
Hugging Face 发布博客详细介绍 Matryoshka 嵌入模型(套娃嵌入)的概念、优势及使用方法。文章解释了该模型如何通过将重要信息前置到低维部分,实现在不显著损失性能的前提下截断向量以节省存储和提升检索速度。
Hugging Face 宣布全面支持 Google 发布的开源大模型 Gemma,提供 Transformers 集成及云端部署方案。Gemma 包含 2B 和 7B 参数版本,支持消费级 GPU 运行,并给出了基于 TRL 的单卡微调示例。
推荐理由:原文详细说明了 Gemma 在 Hugging Face 生态中的集成方式、硬件适配性及微调流程,为开发者提供了从部署到训练的具体技术路径。
Upstage 于2023年9月发起 Open Ko-LLM Leaderboard,旨在建立透明、公平的韩语大模型评估生态。该平台采用 Ko-MMLU 等五项私有测试集以防止数据污染,上线五个月即收录超1,000个模型。KT 的 Mi:dm 7B 在7B参数以下模型中排名第一并开放使用,SOLAR 及基于 LLaMA2、Yi、Mistral 微调的模型表现强劲。
Hugging Face 在 PEFT 库中发布了针对 LoRA 适配器的新合并方法,支持 cat、linear、svd、ties、dare 和 magnitude_prune 等算法。
推荐理由:原文详解了PEFT新增的多种LoRA适配器合并算法及代码示例,提供了从文本到图像生成的具体实践指南与参数调优建议。
Hugging Face 发布教程展示如何利用开源 Mixtral-8x7B-Instruct-v0.1 模型生成合成数据,以微调 RoBERTa-base 等小型专用模型。
推荐理由:通过金融情感分析案例演示了利用开源大模型生成合成数据并微调小模型的完整流程,提供了具体的成本与性能对比数据及可复用的代码仓库。
AMD 与 Hugging Face 联合推出 Pervasive AI Developer Contest,提供 Generative AI、Robotics AI 和 PC AI 三个赛道,总奖金达 $160,000 USD。
Hugging Face 在 Text Generation Inference (TGI) v1.4.0 中推出 Messages API,提供与 OpenAI Chat Completion API 的兼容性,允许用户从 OpenAI 模型无缝迁移到开源 LLM。
推荐理由:TGI 1.4.0 新增兼容 OpenAI Chat Completion API 的 Messages API,支持通过修改 base_url 无缝切换至开源模型,并兼容 LangChain 和 LlamaIndex。
Hugging Face 推出 SegMoE 框架,允许用户通过替换 Stable Diffusion 中的 Feed-Forward 层来从零开始创建混合专家(MoE)扩散模型。
Hugging Face 推出 NPHardEval 排行榜,利用密歇根大学等研发的基准测试大语言模型推理能力。该基准包含900道算法题,涵盖P、NP-complete及NP-hard复杂度类,并每月动态更新以防止过拟合。实验显示GPT 4 Turbo整体表现最佳,Claude 2在NP-complete问题上领先,Yi-34b等开源模型亦具竞争力。
Hugging Face 提供 PatchTST 在 Electricity 数据集上的预测及 ETTh1 零样本迁移示例。该模型通过子序列补丁化和通道独立设计,利用 Transformer 编码实现长期预测。开发者可结合 IBM tsfm 包进行线性探测或微调以优化目标域性能。
Hugging Face Text Generation Inference (TGI) 现已在 AWS Inferentia2 和 Amazon SageMaker 上正式可用。