使用 Optimum-Intel 和 OpenVINO GenAI 优化部署 Llama 3.1 模型
Hugging Face 指导利用 Optimum-Intel 与 OpenVINO GenAI 将 meta-llama/Meta-Llama-3.1-8B 导出为 IR 格式并优化。通过 NNCF 框架支持 INT4/INT8 权重量化,结合 AWQ 等技术降低边缘设备延迟。该方案简化了 C++ 或 Python 环境下的 LLM 推理集成,实现高效低依赖部署。
Hugging Face 指导利用 Optimum-Intel 与 OpenVINO GenAI 将 meta-llama/Meta-Llama-3.1-8B 导出为 IR 格式并优化。通过 NNCF 框架支持 INT4/INT8 权重量化,结合 AWQ 等技术降低边缘设备延迟。该方案简化了 C++ 或 Python 环境下的 LLM 推理集成,实现高效低依赖部署。
Hugging Face 发布技术博客,介绍如何通过特定技巧将现有的 Llama3 8B 模型微调至 BitNet 架构支持的 1.58bit 极限量化水平。团队通过引入动态 lambda 值逐步应用量化以解决权重分布突变导致的性能损失,最终在仅使用 10B tokens 微调的情况下使模型在 MMLU 基准测试中超越 Llama 1 7B。
推荐理由:原文详细拆解了将 Llama3 微调至 1.58bit 的量化技巧与动态 lambda 调度策略,为低精度模型部署提供了可复现的工程路径。
Hugging Face Hub 为 Datasets 推出了新的 SQL Console 功能,允许用户直接在浏览器中通过 SQL 查询、过滤和发现数据集。该控制台由 DuckDB WASM 驱动,支持完整的 DuckDB 语法及正则、JSON 等内置函数,且无需任何服务器依赖。用户可将查询结果导出为 Parquet 文件或通过链接分享,目前内存限制约为 3GB,适用于大多数常规查询场景。
推荐理由:官方介绍了基于 DuckDB WASM 的浏览器内 SQL 查询功能,无需后端即可直接筛选和转换数据集,适合需要快速处理 Parquet 数据的开发者。
HuggingFace 在 HuggingChat 中发布 Community Tools 功能,允许用户将任何公开的 HuggingFace Space 转化为模型可直接调用的工具。
推荐理由:官方展示了将任意 Space 转为工具的流程,并提供了 RAG 模板,读者可据此扩展聊天助手的多模态能力。
Hugging Face 发布 Accelerate 1.0.0 首个候选版本,该库支持六种硬件加速器并集成 FP8、DeepSpeed 多模型编排及 torch.compile。用户可通过 pip install --pre accelerate 或 Docker 镜像试用,部分参数配置已迁移至 DataLoaderConfiguration。
Hugging Face 宣布与 Truffle Security 合作,将开源工具 TruffleHog 的密钥扫描功能集成至平台。该集成扩展了自动安全扫描管道,新增针对密码、令牌和 API 密钥的检测能力,并在发现已验证泄露时通知用户。同时推出原生 `trufflehog huggingface` 命令,支持用户主动扫描模型、数据集及 Spaces 中的敏感信息。
Hugging Face 推出 LeRobotDataset 格式,利用视频编码技术将机器人视觉数据平均压缩至原大小的 14%。该方案在保持训练质量的同时,单帧解码速度与 PNG 相当,多帧连续读取速度提升 25%-50%,有效解决了机器人领域缺乏轻量、高效且易于共享的数据格式难题。
Hugging Face Hub 推出 ZeroGPU、多进程 Docker、Gradio API、Webhooks 和 Nomic Atlas 五项功能,助力构建 AI 解决方案。ZeroGPU 基于 Nvidia A100 提供免费 GPU 配额,Nomic Atlas 支持语义搜索可视化。这些工具通过 Reddit 数据源案例演示了如何低成本实现自动更新的语义搜索应用。
Hugging Face Transformers 新增 DataCollatorWithFlattening,使 Flash Attention 2 支持无填充序列打包。该功能在 FLAN 数据集上实现 llama2-7B 等模型最高 2x 训练吞吐提升,峰值内存降低 20%,且保持收敛质量不变。
Hugging Face 演示如何在 Google Cloud Vertex AI 上部署 Meta Llama 3.1 405B FP8 量化模型。该方案利用配备 8 张 H100 GPU 的 A3 节点及 Text Generation Inference (TGI) 容器,支持通过代码或 Hub 直接调用进行在线推理。
Hugging Face 团队分享了复现 Google Infini-attention 的实验结果,发现随着内存压缩次数增加,模型在长上下文任务中的性能显著下降且不可靠。
推荐理由:作者详细记录了复现Infini-attention的调试过程与失败原因,揭示了长上下文扩展中压缩记忆的性能瓶颈及收敛难点。
ggml 是一个专注于 Transformer 推理的开源 C/C++ 机器学习库,被 llama.cpp、Ollama 等项目用于实现端侧 LLM。其核心优势在于极简主义(少于 5 个文件)、轻量级(二进制小于 1MB)及支持 x86_64、ARM、Apple Silicon 等多硬件后端。开发者需理解 ggml_context、ggml_cgraph 等底层概念以进行高效计算图调度与内存管理。
Technology Innovation Institute (TII) 发布了基于 Mamba 架构的 7B 参数大语言模型 Falcon Mamba,采用 TII Falcon Mamba 7B License 1.0 协议开源。
推荐理由:TII 在 Hugging Face 博客详细披露了 Falcon Mamba 的架构设计、训练数据及基准测试对比,展示了纯 SSM 模型在长序列处理上的效率优势。
Hugging Face 推出跨 Mistral、Cohere、NousResearch 和 Llama 等模型的统一工具调用 API,使同一套代码可移植且无需针对特定模型修改。
推荐理由:原文提供了跨模型统一的工具调用 API 实现细节与代码示例,开发者可直接复用该方案解决多模型适配难题。
Hugging Face 正式宣布收购西雅图初创公司 XetHub,旨在将其技术整合至 Hub 以替代 Git LFS 作为存储后端。XetHub 团队由前 Apple ML 基础设施成员组成,其核心技术支持 TB 级仓库的 chunked files 和去重功能,能显著减少如 Parquet 文件或 GGUF 模型更新时的重复上传量。
推荐理由:原文披露了收购动机及具体技术场景,读者可据此理解 Hugging Face 如何通过替换存储后端解决超大模型文件的版本管理痛点。
Hugging Face 联合 Albumentations AI 发布 TextImage 数据增强管线,专为视觉语言模型微调设计。该多模态方法通过随机插入、删除或交换文本并同步修复图像背景,在保留语义的同时生成合成训练数据。开发者可通过 `albumentations` 库调用,支持 IDL 和 PDFA 数据集以解决小样本下的 OCR 精度问题。
Hugging Face 发布2024年安全功能概览,涵盖细粒度令牌、双因素认证及提交签名等默认防护机制。平台通过 ClamAV 和 picklescan 实现自动化恶意软件与密钥扫描,保障 Hub 用户资产安全。企业版额外提供 SSO 单点登录及资源组隔离等高级控制选项。
Google 在 Hugging Face 博客宣布扩展 Gemma 模型家族,新增 Gemma 2 2B、ShieldGemma 安全分类器和 Gemma Scope 稀疏自编码器套件。
推荐理由:原文详细展示了 Gemma 2 2B 在端侧部署与辅助生成中的具体用法,以及 ShieldGemma 和 Gemma Scope 的开源特性,为开发者提供了可落地的技术参考。
Hugging Face 官方博客发布教程,指导如何使用 Quanto 工具对 Diffusers 库中的 Transformer 架构扩散模型进行量化,以显著降低显存需求。
Hugging Face 联合 NVIDIA 推出基于 NIM 的 Serverless Inference API,支持 Enterprise Hub 用户通过 OpenAI 兼容接口调用 Llama、Mistral 等开源模型。该服务运行于 NVIDIA H100 GPU,采用按请求时长计费模式,例如 Meta-Llama-3-8B-Instruct 单次请求约 $0.0023。
Hugging Face 提出 LAVE(LLM-Assisted VQA Evaluation)指标,利用 Llama-2-Chat-7b 对 Docmatix 数据集进行零样本 VQA 评估。
Hugging Face 正式上架 Meta 发布的 Llama 3.1 系列模型,包含 8B、70B 和 405B 三种尺寸的基座与指令微调版本,以及 Llama Guard 3 和 Prompt Guard 安全模型。
推荐理由:原文详细列出了 Llama 3.1 各尺寸模型的显存需求、量化方案及微调代码,为开发者评估部署成本和集成路径提供了具体参考。
Hugging Face 发布教程,指导开发者利用 WWDC 24 引入的 Core ML 新特性在 Mac 上运行 Mistral 7B 模型。通过 Swift Tensor、Stateful Buffers 和块量化技术,该方案能将 70 亿参数模型的内存占用降至 4GB 以下。
推荐理由:原文详细演示了利用WWDC 24新特性将Mistral 7B转换为Core ML模型并实现端侧高效推理的完整流程。
Hugging Face 推出 Docmatix,包含 240 万张图像和 950 万组问答对,规模是现有 DocVQA 数据集的 240 倍。该数据由 PDFA 经 Phi-3-small 生成并过滤幻觉后构建。实验显示,用其微调 Florence-2 模型可使 DocVQA 性能提升约 20%,且 0.7B 参数版本表现仅比 8B Idefics2 低 5%。
Hugging Face 为 Text Generation Inference (TGI) 推出 Multi-LoRA serving 功能,支持在单次部署的基础模型上动态加载并服务多达 30 个 LoRA 适配器。
推荐理由:TGI 新增 Multi-LoRA 功能,允许在单一基础模型部署中动态加载多个微调适配器,显著降低多模型服务的运维成本与复杂度。
Mistral AI 推出 Mathstral,该模型基于 Mistral 7B 构建,专攻 STEM 领域复杂逻辑推理。Mathstral 在 MATH 基准测试中得分 56.6%,MMLU 得分 63.47%;结合多数投票机制后,MATH 分数提升至 68.37%。
Hugging Face 推出 SmolLM 系列小语言模型,包含 135M、360M 和 1.7B 三种参数规模,并同步开源了用于训练的 SmolLM-Corpus 数据集。
推荐理由:官方开源了SmolLM系列小模型及其高质量训练语料,展示了在端侧设备上的优异性能与数据构建细节。
Hugging Face 利用 distilabel 生成合成数据,微调领域专用嵌入模型以构建 Argilla 2.0 Chatbot。该流程包括将技术文档分块、创建向量数据库,并将应用部署至 Hugging Face Spaces。
Numina 与 Hugging Face 联合团队凭借 NuminaMath 7B TIR 模型赢得首届 AI 数学奥林匹克(AIMO)进步奖,在私有测试集上解出 29/50 道题。
Hugging Face 推出 KerasHub 与 Transformers 的共享模型保存格式,允许 KerasHub 直接加载 Hub 上超 30 万个基于 Transformers 的模型。该集成初期支持 Gemma、Llama 3 和 PaliGemma,用户可通过单行代码在 TensorFlow、JAX 或 PyTorch 后端间无缝切换并微调上传。
Hugging Face 在 Dataset Hub 推出新功能,利用开源工具 Presidio 自动生成数据集个人身份信息(PII)检测报告。该功能旨在帮助机器学习从业者识别预训练数据中残留的敏感信息,辅助其在模型训练前进行数据过滤与合规性验证。
Hugging Face 宣布 TRL 库现已支持对视觉语言模型进行直接偏好优化(DPO)。该教程以 Idefics2-8b 为例,展示了如何利用 LoRA 和量化技术将显存需求从 160GB 降至约 32.3GB,并在 AMBER 基准测试中验证了微调后模型幻觉率的降低。
Banque des Territoires、Polyconseil 与 Hugging Face 合作开发基于开源生态的主权 RAG 解决方案,以优化法国 EduRénov 学校翻新计划的邮件响应效率。该方案利用 Text Generation Inference 等工具保障数据主权,旨在通过生成式 AI 简化对 10,000 个公共教育设施项目的支持流程。
Hugging Face 宣布在其 Inference Endpoints 和 Spaces 中正式支持 Google Cloud TPUs。用户现在可以选择 TPU v5e 实例(v5litepod-1/4/8)来部署模型,每小时价格从 $1.375 到 $11.00 不等。
Hugging Face Dataset Hub 推出四项新搜索功能,支持按模态、行数规模、存储格式及兼容库筛选超过180,000个公开数据集。用户可组合这些过滤器与现有语言、任务等条件,精准定位如用于LLM预训练的超10B行数据或特定WebDataset格式资源。
ProtST 蛋白质语言模型在 Intel Gaudi 2 上实现高效推理与微调。借助 Optimum for Intel Gaudi 库,其零样本推理速度比 NVIDIA A100 快 1.76 倍且精度一致;微调任务中单卡 Gaudi 2 较 A100 提速 2.92 倍,多卡训练可线性扩展。
Hugging Face 使用基于 transformers.agents(现已升级为 smolagents)构建的 ReactCodeAgent 在 GAIA 基准验证集上取得 44.2% 的成绩,位列第一。该方案核心在于让 LLM 生成并执行 Python 代码而非 JSON,通过自底向上构建的安全解释器限制操作权限,并结合 Web 浏览、文件检查等工具及简单的规划组件实现多智能体协作。
推荐理由:原文详细拆解了基于代码动作的 Agent 架构与安全执行机制,并展示了在 GAIA 基准上的具体得分与多智能体编排策略。
Google 发布了最新一代开源大语言模型 Gemma 2,包含 9B 和 27B 两种参数规模的基座与指令微调版本。该模型引入了滑动窗口注意力、Logit 软封顶、知识蒸馏和模型合并等四项主要技术进步,上下文长度为 8K tokens。Hugging Face 已同步提供 Transformers 集成、Inference Endpoints 部署支持以及基于 TRL 的微调示例代码。
推荐理由:原文详细解析了Gemma 2在滑动窗口注意力、软封顶及知识蒸馏上的技术改进,并提供了基于Transformers的微调与部署指南。
XLSCOUT 推出专有嵌入模型 ParaEmbed 2.0,准确率较前代提升 23%。该模型基于 Hugging Face Expert Support Program 协作开发,通过微调 BGE、Llama 2 等开源模型优化专利分析。借助 Inference Endpoints,其推理速度达 ~2700 embeddings per second,显著增强专利起草与检索效率。
Hugging Face 发布教程展示如何微调 Microsoft 的 Florence-2 模型以支持 DocVQA 任务。通过冻结视觉编码器并在单张 A100 GPU 上使用 batch size 6 进行 7 个 epoch 的训练,验证集上的 Levenshtein 相似度从 0 提升至 57.0。该过程证明了小参数量视觉语言模型在受限资源下适配下游任务的可行性。