Hugging Face 发布伦理与社会通讯第5期:分享华盛顿立法倡导及2023年夏季AI伦理进展
Hugging Face 发布《伦理与社会通讯》第5期,汇总 CEO Clem 在美国国会作证、欧盟 AI 法案建议等立法倡导活动。团队通过媒体评论与 TED 演讲阐释开源 AI 价值,并推进 IDEFICS 多模态模型偏见测试及内容政策更新。
Hugging Face 发布《伦理与社会通讯》第5期,汇总 CEO Clem 在美国国会作证、欧盟 AI 法案建议等立法倡导活动。团队通过媒体评论与 TED 演讲阐释开源 AI 价值,并推进 IDEFICS 多模态模型偏见测试及内容政策更新。
Hugging Face 推出教程,指导非技术人员利用 AutoTrain、Spaces 和 ChatUI 零代码微调 LLaMA 2 并部署聊天应用。该方案基于 Meta 的 Llama 2 7b 基础模型,通过开源指令数据集进行微调,最终生成可分享的对话界面,旨在降低大语言模型的使用门槛。
Hugging Face 针对 Llama 2 在 Amazon SageMaker 部署开展基准测试,评估了 60 种配置下的延迟与吞吐量。该研究基于 Text Generation Inference (TGI) 容器,对比了 GPTQ 4-bit 量化及不同 EC2 实例性能,旨在为成本、低延迟和高吞吐场景提供最优部署建议。
Hugging Face 推出 Inference for PRO,为付费用户提供 Meta Llama 3、Mixtral 8x7B 等精选模型的专属 API 端点及更高速率限制。该服务基于 text-generation-inference 实现超快推理,支持通过 HTTP POST 或 huggingface_hub Python 库调用,适用于原型开发而非重型生产环境。
Rocket Money 选择 Hugging Face Inference API 托管其 BERT 系列文本分类模型,以替代原有正则表达式系统处理每月超 1 亿笔交易。该方案解决了小团队缺乏 MLOps 专业知识的痛点,实现了动态扩展和低延迟推理。经过三个月评估,Hugging Face 凭借快速部署能力和合作伙伴支持成为最终选择。
Hugging Face 推出 Object Detection Leaderboard,对 Hub 上的开源目标检测模型进行排名。该博客深入解析 IoU、Average Precision (AP) 和 Average Recall (AR) 等核心评估指标的计算方法。文章旨在帮助开发者理解不同报告间结果差异的原因,从而更批判性地评估模型性能并选择最适合应用需求的模型。
3D Gaussian Splatting 是一种基于高斯椭球的光栅化技术,支持从少量图像实时渲染照片级真实场景。其训练流程包含 SfM 点云估计、SGD 优化及自动稠密化剪枝,但存在显存占用高(查看需 4GB)和磁盘体积大等局限。目前 CUDA 实现尚未适配主流生产管线,WebGPU 等替代方案正在探索中。
Hugging Face 发布博客文章,系统介绍了大语言模型在生产环境中降低显存需求和提升推理效率的三大核心技术:低精度量化(8-bit/4-bit)、Flash Attention 算法以及针对长文本优化的模型架构(如 RoPE、ALiBi、MQA 和 GQA)。
推荐理由:原文通过代码实测对比了低精度量化、Flash Attention 及 MQA/GQA 架构在显存占用与推理速度上的具体差异,为 LLM 生产环境优化提供了可复用的技术选型依据。
Hugging Face 发布新扩散模型 Würstchen,其文本条件组件在高度压缩的图像潜空间中工作,实现了 42 倍的空间压缩。
Hugging Face 演示如何利用 PyTorch FSDP、Transformers、Accelerate 和 TRL 微调 Llama 2 70B。通过仅在 rank 0 加载权重并广播至其他设备,解决了多 GPU 并行加载导致的 CPU 内存溢出问题。该方案在 2 节点 16 张 A100 GPU 环境下运行,显著降低了显存占用并提升了训练速度。
Hugging Face Transformers 原生集成 bitsandbytes 和 auto-gptq 两种量化方案,分别适用于零样本推理/微调及高速文本生成。bitsandbytes 支持多模态模型且无需校准数据,但 4-bit 权重暂不支持序列化;auto-gptq 在文本生成上速度更快并支持 AMD GPU,但需数小时进行模型校准。
Hugging Face 推出企业级代码助手 SafeCoder,基于 15.5B 参数的开源 StarCoder 模型。该方案支持私有化部署与微调,提供透明训练数据及无遥测隐私保护,解决闭源服务无法定制的问题。
Hugging Face Diffusers团队联合T2I-Adapter作者发布了针对Stable Diffusion XL (SDXL)的T2I-Adapter支持,提供sketch、canny、lineart、depth和openpose等多种条件的预训练检查点。
推荐理由:原文提供了T2I-Adapter在SDXL上的训练细节、参数对比及diffusers库中的具体代码用法,便于开发者复现高效可控生成。
TII 发布的 Falcon 180B 正式登陆 Hugging Face Hub,提供 base 和 chat 版本。该模型拥有 1800 亿参数,基于 RefinedWeb 数据集在 3.5 万亿 tokens 上完成预训练,是当时最大的公开可用语言模型。其性能在多项基准测试中超越 Llama 2 70B,接近 PaLM-2 Large,但商用许可对托管使用有严格限制。
推荐理由:原文给出了 Falcon 180B 的参数量、训练数据规模及硬件需求,读者可据此评估其在开源大模型中的性能定位与部署门槛。
Fetch 通过迁移至 Amazon SageMaker 并集成 Hugging Face AWS Deep Learning Container,成功将其最慢扫描的机器学习处理延迟降低 50%,同时文档理解模型准确率提升 200%。该方案支持每周处理超过 8000 万张收据,利用多 GPU 实例和并行训练实现了高并发下的快速推理与规模化部署。
Hugging Face 发布教程展示如何在 🧨 Diffusers 库中优化 AudioLDM 2 模型的推理速度,将生成 10 秒音频的时间从约 30 秒缩短至不到 1 秒。
推荐理由:原文通过逐步演示代码优化技巧,展示了如何将 AudioLDM 2 的推理时间缩短十倍以上,为开发者提供了可直接复用的性能调优方法。
Hugging Face 宣布在生态系统中集成 Meta 发布的 Code Llama 模型系列,提供 transformers 4.33+ 支持、Text Generation Inference 部署及 VS Code 扩展。
推荐理由:原文给出了 Code Llama 在 Hugging Face 生态中的集成方式、不同参数规模的能力差异以及具体的部署与微调建议,读者可以据此判断如何将其接入现有开发工作流。
Hugging Face 宣布将 AutoGPTQ 库集成到 Transformers 中,允许用户使用 GPTQ 算法以 8、4、3 或 2-bit 精度对大语言模型进行量化和运行。
推荐理由:官方详细说明了 AutoGPTQ 集成后的量化精度、显存节省数据及多硬件支持情况,为开发者评估低资源部署方案提供了具体技术依据。
Hugging Face 推出开源视觉语言模型 IDEFICS,作为 DeepMind Flamingo 的公开复现版本。该模型提供 9B 和 80B 参数两种规模及指令微调变体,支持图文交错输入与文本生成。训练数据包含新创建的 115B token 数据集 OBELICS,模型权重在 Hugging Face Hub 上线并集成至 transformers 库。
推荐理由:原文公开了基于 Flamingo 架构的开源复现细节及 OBELICS 数据集,为社区提供了可验证的多模态大模型训练基准。
Hugging Face 发布 SafeCoder,这是一款基于 StarCoder 模型的企业级自托管代码助手解决方案。该方案允许客户在自有基础设施上微调专有代码库,确保数据在训练和推理期间不离开 VPC。SafeCoder 支持 NVIDIA、AMD 等多种硬件加速部署,旨在提供合规且私有的“内部 GitHub Copilot”体验。
Hugging Face Hub 正式入驻 AWS Marketplace,用户现可通过 AWS 账户直接订阅并支付 Inference Endpoints、Spaces Hardware Upgrades 及 AutoTrain 等服务费用。该集成计费方式允许组织成员统一通过 AWS 账单结算,无需绑定信用卡,旨在降低企业采用 Llama 2、StarCoder 等大语言模型的技术门槛。
Hugging Face 发布教程,演示如何利用 Optimum 和 Accelerate 库优化基于 🤗 Transformers 的 Bark 文本转语音模型。该方案通过少量代码即可降低内存占用并提升推理速度,文中提供了针对 Bark small 检查点的基准测试结果及 Google Colab 示例。
BentoML 开源平台支持将 Hugging Face 上的 DeepFloyd IF 文本生成图像模型部署至生产环境。该流程涵盖定义模型、创建 Service、构建 Bento 及容器化部署,利用 T5-XXL-1.1 编码提示词并分三阶段在像素空间生成 1024x1024 px 图像。开发者可独立扩展各 Stage Runner 以优化 GPU 资源分配与推理性能。
Hugging Face 发布 swift-transformers、swift-chat 及更新的模型导出工具,旨在帮助开发者在 Mac 和 iPhone 等苹果设备上通过 Core ML 运行 Llama 2 等大语言模型。
推荐理由:原文提供了在苹果设备上运行大语言模型的完整工具链和转换指南,开发者可据此评估本地化部署的可行性。
Hugging Face 博客介绍了如何在 TRL 库中使用直接偏好优化(DPO)方法微调 Llama v2 7B 模型。文章详细演示了从监督微调(SFT)到 DPO 训练的全流程,包括数据格式准备、QLoRA 配置及关键超参数 beta 的设置,并提供了可复用的代码示例和最终模型链接。
推荐理由:提供了在TRL库中使用DPO微调Llama 2的完整代码与流程,展示了如何绕过复杂RLHF步骤直接优化偏好数据。
Hugging Face 演示如何通过自定义 handler 在 Inference Endpoints 上部署 MusicGen。该流程支持文本生成音乐及可选旋律条件,适用于无原生 pipeline 的模型。用户需复制 facebook/musicgen-large 仓库并添加依赖文件即可实现一键部署。
Hugging Face 联合 Zama 利用全同态加密(FHE)技术,在保护用户隐私和模型 IP 的同时运行 GPT2 推理。通过 Concrete-Python 将 Python 函数转换为 FHE 等效操作,并采用量化技术处理权重与激活值。实验显示,对单个注意力头进行 4-bit 量化后,模型仍保持原始精度的 96%。
Hugging Face 推出 Huggy Lingo,利用机器学习检测 Hub 上缺失语言元数据的约 87% 数据集。该方案通过 dataset viewer API 获取文本样本,调用 facebook/fasttext-language-identification 模型识别 217 种语言,并借助 librarian-bots 自动提交 PR 补充元数据,以提升多语言数据集的可发现性。
Segmind 开源基于知识蒸馏训练的 SD-Small 和 SD-Tiny 模型权重及代码,二者参数量分别比基础模型减少 35% 和 55%,推理速度提升最高达 100%。该工作以 Realistic-Vision 4.0 为教师模型,在 LAION Art Aesthetic 数据集上训练,旨在通过压缩生成式 AI 模型实现更快速、低成本的图像生成。
Hugging Face 提供基于 Shap-E 和 Dream Textures 的 PS1 风格 3D 资产生成工作流。该教程指导用户利用 OpenAI 开源扩散模型 Shap-E 生成低多边形模型,并通过 Blender 插件 Dream Textures 添加无缝纹理。最终导出 FBX 文件至 Unity,实现从文本到可用游戏资产的快速转化。
Hugging Face 联合 Apple 发布 Stable Diffusion XL 的 Core ML 版本,并介绍混合位量化技术以优化 Mac 端运行效率。该技术在保持高画质的同时将模型体积压缩至 1.4 GB(减少 71%),支持在 macOS 14 beta 上通过 CPU+GPU 运行。官方已开源转换脚本、推理 Demo 及预计算量化配方,开发者可直接复用或应用于其他微调模型。
推荐理由:文章详解了混合位量化技术原理及在 Stable Diffusion XL 上的应用,提供了从模型转换到性能测试的完整开源工具链。
Hugging Face 发布 Agents.js,这是一个允许在浏览器或服务器端通过 JavaScript 赋予大语言模型工具访问权限的新库。该库默认使用 OpenAssistant/oasst-sft-4-pythia-12b-epoch-3.5 模型,支持自定义 LLM 及扩展多模态工具,但直接运行代码存在安全风险,建议配合 generateCode 和 evaluateCode 方法使用。
Hugging Face 与 Creative Commons、Eleuther AI、GitHub、LAION 及 Open Future 联合发布立场文件,阐述开放 ML 开发对欧盟 AI 法案目标的支持作用。该文件提出五项建议,包括明确定义 AI 组件、澄清开源协作开发不受法案约束、支持 AI Office 与开源生态协调、确保 R&D 例外实用性以及为“基础模型”设定比例要求。
Hugging Face 官方博客于2023年7月18日发布了一篇关于模型发布的文章。
Hugging Face 发布伦理与社会通讯,深入分析 Stable Diffusion、DALL-E 2 等文本到图像模型的偏见成因。文章指出训练数据(如 LAION-5B)、CLIP 推理偏差及潜在空间结构均会导致刻板印象输出。Hugging Face 通过 Stable Bias 项目展示相关探索工具,强调需结合技术手段与社会语境共同应对多模态生成中的公平性挑战。
Hugging Face 团队分析了 Open LLM Leaderboard 上 MMLU 分数与论文数据不一致的原因,指出不同评估实现导致结果显著差异。文章对比了 EleutherAI Harness、Stanford HELM 和原始实现三种方法在提示词构造及概率计算上的区别,展示了同一模型在不同方法下的得分变化。最终确认社区维护的评估库更新后已对齐原始实现,并将重新运行排行榜以修正数据。
推荐理由:原文通过对比三种 MMLU 实现方式,揭示了评估细节对模型分数的巨大影响,为理解 LLM 评测差异提供了具体案例。
Hugging Face 向美国 NTIA 提交关于 AI 问责政策的回复,强调文档与透明度在驱动问责中的作用。建议问责机制应覆盖机器学习开发全流程,结合内部要求与外部访问,并邀请开发者、研究人员及政策制定者等广泛利益相关方参与。
Hugging Face 博客发布了针对低资源语言自动语音识别(ASR)的 MMS Adapter 模型微调教程。该教程展示了如何通过仅训练少量 Adapter 权重,在 Common Voice 数据集上实现比全量微调 XLS-R 更高效、更鲁棒的性能提升。
Hugging Face 通过基准测试证明,Autoformer 模型在 Traffic、Exchange-Rate 和 Electricity 数据集上的 MASE 指标均优于 DLinear,反驳了 Transformer 无效论。同时,NeurIPS 2021 论文提出的 Autoformer 已正式集成至 🤗 Transformers 库,其核心创新包括分解层与自相关机制。
Hugging Face 联合 Apple 推出基于 Core ML 的 Stable Diffusion 加速方案,利用 6-bit palettization 技术显著降低模型体积并提升 iPhone、iPad 和 Mac 上的推理速度。
推荐理由:官方展示了 Core ML 6-bit 量化在 iPhone 上的实测提速与内存节省,并提供了可直接下载的优化模型及自定义转换指南。