Hugging Face 发布 Optimum-NVIDIA 库以加速 LLM 推理
Hugging Face 推出 Optimum-NVIDIA 推理库,旨在通过 NVIDIA TensorRT-LLM 和 FP8 格式大幅加速大语言模型推理。
Hugging Face 推出 Optimum-NVIDIA 推理库,旨在通过 NVIDIA TensorRT-LLM 和 FP8 格式大幅加速大语言模型推理。
Hugging Face 在 Hub Inference API 中实现了 LoRA 适配器的动态加载机制,通过将请求路由至共享的基础模型后端并即时切换轻量级适配器,使响应时间从 35s 降至 13s。该方案利用 Diffusers 库的 load/unload 功能,让数百个不同的 LoRA 模型仅需不到 5 张 A10G GPU 即可服务,显著降低了计算资源消耗。
Hugging Face 发现 Open LLM Leaderboard 中多数模型在 DROP 基准的 f1-score 低于 10,主要源于归一化逻辑缺陷及生成停止符设置不当。具体表现为数字后接非空格字符导致匹配失败,以及使用句号作为停止符截断浮点数答案或引发长文本冗余。团队提出改用换行符作为结束标记以修正评分偏差。
OpenAI 通过官方新闻发布关于董事会和管理层重大人事变动的公告。该消息标志着公司治理结构的直接调整。
推荐理由:OpenAI 官方渠道确认了人事变动,读者可据此了解公司高层架构的最新调整。
OpenAI 官方发布消息,宣布公司进行领导层人事调整。
OpenAI 宣布建立数据合作伙伴关系,旨在共同创建用于 AI 训练的开源和私有数据集。该合作聚焦于通过多方协作丰富训练数据来源,支持人工智能模型的持续开发与优化。
Hugging Face 推出 Latent Consistency Models (LCM) LoRAs,允许在 Stable Diffusion XL 和 SD v1.5 等模型上通过仅 4-8 步推理实现高质量图像生成,显著加速过程(如 M1 Mac 上从约 60 秒降至 6 秒)。
推荐理由:提供了将LCM LoRA应用于SDXL等模型的具体代码与基准测试,展示了如何在保持画质的前提下大幅降低推理步数并提升生成速度。
Hugging Face 推出 optimum-neuron 工具,支持在 AWS Inferentia2 上部署 Llama 2 模型以加速文本生成。用户可通过 NeuronModelForCausalLM API 将 Llama-2-7b-hf 等模型编译导出至 Neuron 格式,并配置 num_cores、batch_size 及 sequence_length 参数优化推理性能。
Explosion 推出 Prodigy-HF 插件,实现 Prodigy 标注工具与 Hugging Face 生态的直接集成。该插件支持通过 `hf.train.ner` 等命令微调任意 Transformer 模型(如 distilbert-base-uncased),并允许将标注数据集上传至 Hugging Face Hub。
该研究利用 LoRA 技术对 RoBERTa-large (355M)、Llama-2-7b 和 Mistral-7B-v0.1 (7.3B) 进行序列分类微调,以评估其在灾难推文分析任务上的性能。实验在单张 A6000 GPU 上完成,旨在通过参数高效微调方法比较不同规模模型的效果。
OpenAI 在 DevDay 上宣布推出 GPT-4 Turbo 模型以及一系列面向开发者的新产品。此次更新重点包括支持更长上下文窗口的 GPT-4 Turbo,旨在提升模型处理复杂任务的能力并优化开发体验。
推荐理由:官方在 DevDay 集中发布了新模型与开发者工具,明确了当前 API 能力的升级方向。
OpenAI 正式推出 GPTs,这是一项新功能,允许用户通过自然语言对话轻松创建个性化的 ChatGPT 版本。用户可以自定义指令、上传知识文件并配置外部动作,从而构建针对特定任务或领域的专用智能体,且全程无需编写代码。
推荐理由:OpenAI 官方发布 GPTs,允许用户通过自然语言创建定制化的 AI 助手,无需编写代码即可结合指令、知识和动作。
Hugging Face 在 Enterprise Hub 计划中推出 Storage Regions 功能,允许用户指定模型和数据集的存储位置。目前支持美国(US)和欧盟(EU)区域,亚太地区即将上线。该功能旨在满足 GDPR 等合规要求并提升数据主权,同时优化性能:例如将仓库存储在欧盟区域的欧洲用户,其上传下载速度比存储在美国时快约 4-5 倍。
Hugging Face 发布教程展示如何微调 StarCoder 模型创建个人编程助手 HugCoder。文章详述了从 GitHub 收集数据、使用 PEFT (QLoRA) 进行高效微调的流程,并对比了不同硬件配置下的训练成本与效果。此外,还提供了通过 VS Code 插件集成云端推理端点以及在 Mac 等消费级设备上本地部署小参数模型的实操步骤。
推荐理由:原文提供了基于私有代码库微调 StarCoder 的完整工作流,包含 QLoRA 与全量微调的成本对比及本地部署方案。
OpenAI 正在开发针对高能力 AI 系统的灾难性风险准备方法,以支持其安全性。该举措包括组建 Preparedness 团队并启动一项挑战活动。
OpenAI、Anthropic、Google 和 Microsoft 共同宣布 Frontier Model Forum 新任执行董事,并设立 1000 万美元的 AI Safety Fund。该基金旨在支持前沿模型的安全研究与发展。
Renumics Spotlight 支持通过一行代码在 Hugging Face datasets 库中创建交互式可视化,直接识别数据中的关键聚类。该工具利用模型预测和嵌入向量深入理解数据段及失败模式,无需复制或预处理即可高效加载结构化与非结构化数据进行调试分析。
Hugging Face 通过 Text Embeddings Inference (TEI) 支持在 Inference Endpoints 上部署开源嵌入模型。该方案针对 MTEB 榜单前 10 模型优化,在 Nvidia A10G 实例上实现 450+ req/sec 吞吐量,成本低至 $0.00156/1M tokens,比 OpenAI Embeddings 便宜 64 倍。
Hugging Face 官方博客发布指南,针对 Stable Diffusion XL (SDXL) 模型提供了一系列推理加速和显存优化方案。
Hugging Face 团队发布博客文章,详细解析了基于 PPO 的 RLHF(人类反馈强化学习)实现细节。该研究成功复现了 OpenAI 2019 年 lm-human-preferences 代码库的学习曲线,并整理了一份关键实施清单。
推荐理由:原文通过复现 OpenAI 早期 RLHF 代码,揭示了 PyTorch 与 TensorFlow Adam 优化器在数值实现上的差异及其对模型训练稳定性的具体影响。
OpenAI 宣布 DALL·E 3 现已在 ChatGPT 中可用。官方同时指出正在推进关于模型输出内容来源(provenance)的研究工作。
Hugging Face 推出 @gradio/lite,这是一个利用 Pyodide 技术让 Gradio 应用直接在浏览器中运行的 JavaScript 库。
推荐理由:官方介绍了基于 Pyodide 的浏览器端 Gradio 运行方案,展示了无需服务器即可部署交互式 ML 应用的代码示例与隐私优势。
Retool 使用 GPT-4 为企业提供快速、安全地构建 AI 驱动应用程序的方法。该方案旨在简化企业级 AI 应用的开发流程,确保在提升效率的同时保障数据安全。
Typeform 借助 GPT-3.5 和 GPT-4,将传统在线表单升级为动态且具备对话能力的数据收集体验。这一转变使数据收集过程更加灵活互动,提升了用户填写体验与数据获取效率。
Ironclad 利用 GPT-4 模型来简化合同审查流程。该应用旨在通过人工智能技术优化法律文档的处理效率,降低人工审核的复杂性。
ONNX Runtime 支持加速 Hugging Face 平台上超过 130,000 个模型,涵盖 BERT、GPT2 等 90 多种架构。以 whisper-tiny 为例,其推理平均延迟较 PyTorch 降低高达 74.30%。该工具通过优化性能助力大语言模型及云端模型的部署。
Hugging Face Diffusers 现已支持通过 JAX 在 Google Cloud TPU v5e 上运行 Stable Diffusion XL,实现高性能且低成本的推理。
Hugging Face 在 tokenizers 中引入 chat_template 属性,允许使用 Jinja 模板保存和加载模型训练时的聊天格式。该功能旨在解决不同模型采用各异的消息转换格式导致输入分布偏移、进而引发严重且难以调试的性能下降问题。开发者可通过 tokenizer.apply_chat_template() 方法自动格式化对话历史,确保推理或微调时的输入与训练数据一致。
推荐理由:原文提供了将聊天格式作为Jinja模板存入tokenizer的方法,有助于开发者规避因格式不匹配导致的模型性能静默下降。
Hugging Face 教程展示如何通过 fork 并配置 AI Comic Factory,利用 Inference API 部署私有空间以消除排队等待。该应用基于 NextJS,需 PRO 账户访问 Llama-2 和 SDXL 1.0 模型,通过设置环境变量将语言与图像引擎指向 INFERENCE_API。目前该集成处于早期阶段,SDXL refiner 等部分功能尚未支持。
Hugging Face 发布指南,演示如何利用 `trl` 库中的 `DDPOTrainer` 对 Stable Diffusion 进行强化学习微调。该方法基于 Denoising Diffusion Policy Optimization (DDPO),将去噪过程建模为多步马尔可夫决策过程以优化人类偏好对齐。
Hugging Face 发布《伦理与社会通讯》第5期,汇总 CEO Clem 在美国国会作证、欧盟 AI 法案建议等立法倡导活动。团队通过媒体评论与 TED 演讲阐释开源 AI 价值,并推进 IDEFICS 多模态模型偏见测试及内容政策更新。
Hugging Face 推出教程,指导非技术人员利用 AutoTrain、Spaces 和 ChatUI 零代码微调 LLaMA 2 并部署聊天应用。该方案基于 Meta 的 Llama 2 7b 基础模型,通过开源指令数据集进行微调,最终生成可分享的对话界面,旨在降低大语言模型的使用门槛。
Mistral AI 发布 Mistral 7B,这是一个拥有 7.3B 参数的语言模型,采用 Apache 2.0 许可证完全开源。该模型在所有基准测试中均优于 Llama 2 13B,在许多基准上超过 Llama 1 34B,并使用分组查询注意力(GQA)和滑动窗口注意力(SWA)以加速推理和处理长序列。
推荐理由:原文给出了 Mistral 7B 在多项基准上超越 Llama 2 13B 的实测数据及 Apache 2.0 开源许可,读者可据此评估小参数模型的性价比与部署可行性。
Mistral AI 发布其首个 70 亿参数模型 Mistral 7B,该模型在所有标准英语和代码基准测试中超越了目前可用的所有高达 130 亿参数的开源模型。公司以 Apache 2.0 许可证开源该模型,旨在通过社区驱动的开放权重方法构建对 AI 寡头的可信替代方案。Mistral AI 承诺将持续发布缩小与黑盒模型性能差距的新模型,并同步推进商业专有模型及托管解决方案的开发。
推荐理由:Mistral AI 阐述开放权重模型对抗闭源垄断的理念,并发布首个超越同量级开源模型的 Mistral 7B。
Hugging Face 针对 Llama 2 在 Amazon SageMaker 部署开展基准测试,评估了 60 种配置下的延迟与吞吐量。该研究基于 Text Generation Inference (TGI) 容器,对比了 GPTQ 4-bit 量化及不同 EC2 实例性能,旨在为成本、低延迟和高吞吐场景提供最优部署建议。
OpenAI 宣布 ChatGPT 新增视觉和听觉功能,支持用户通过图像和语音进行交互。该更新使模型能够处理非文本输入并生成相应回复,扩展了对话场景。
推荐理由:官方宣布 ChatGPT 具备视觉和听觉能力,用户可据此了解交互方式从纯文本向多模态的转变。
Hugging Face 推出 Inference for PRO,为付费用户提供 Meta Llama 3、Mixtral 8x7B 等精选模型的专属 API 端点及更高速率限制。该服务基于 text-generation-inference 实现超快推理,支持通过 HTTP POST 或 huggingface_hub Python 库调用,适用于原型开发而非重型生产环境。
OpenAI 宣布开放 Red Teaming Network,邀请关注模型安全的领域专家加入。该计划旨在通过外部专家参与,提升 OpenAI 模型的安全性。
Rocket Money 选择 Hugging Face Inference API 托管其 BERT 系列文本分类模型,以替代原有正则表达式系统处理每月超 1 亿笔交易。该方案解决了小团队缺乏 MLOps 专业知识的痛点,实现了动态扩展和低延迟推理。经过三个月评估,Hugging Face 凭借快速部署能力和合作伙伴支持成为最终选择。
Hugging Face 推出 Object Detection Leaderboard,对 Hub 上的开源目标检测模型进行排名。该博客深入解析 IoU、Average Precision (AP) 和 Average Recall (AR) 等核心评估指标的计算方法。文章旨在帮助开发者理解不同报告间结果差异的原因,从而更批判性地评估模型性能并选择最适合应用需求的模型。
最多提供 50 页,更早的内容请使用搜索或主题页。