Hugging Face Inference Endpoints 入门指南
Hugging Face 推出 Inference Endpoints,支持将 Hub 模型一键部署至 AWS 等云端托管基础设施。该服务提供 Public、Protected 和 Private 三种安全访问模式,其中 Private 端点通过 AWS PrivateLink 实现 VPC 内隔离访问。用户可配置自动扩缩容及自定义容器,简化生产环境下的模型推理部署流程。
Hugging Face 推出 Inference Endpoints,支持将 Hub 模型一键部署至 AWS 等云端托管基础设施。该服务提供 Public、Protected 和 Private 三种安全访问模式,其中 Private 端点通过 AWS PrivateLink 实现 VPC 内隔离访问。用户可配置自动扩缩容及自定义容器,简化生产环境下的模型推理部署流程。
Hugging Face Diffusers v0.5.1 起支持 Flax,实现 Stable Diffusion 在 Google TPU 上的快速推理。该方案利用 bfloat16 精度和 8 个并行 TPU 设备,通过复制提示词使单批次生成 8 张图像,显著提升吞吐量。
Hugging Face 通过移植模型至 transformers 并结合 Accelerate 实现流水线并行,将 BLOOM 推理延迟降低 5 倍,吞吐量提升 50 倍。针对 176B 参数、352GB 显存需求的模型,团队利用 device_map="auto" 自动分片以适配多 GPU 环境。该优化过程涉及解决 Tensor 并行导致的数值差异及建立严格的生成测试套件以确保模型稳定性。
Hugging Face Hub 现已支持用户直接为模型或数据集生成数字对象标识符(DOI)。该功能通过与 DataCite 合作实现,注册用户在填写元数据后即可获取 DOI,使资源拥有永久链接并便于学术引用。当模型或数据集更新版本时,DOI 可同步更新,旧版本标识符随之失效。
rinna Co., Ltd. 推出 Japanese Stable Diffusion,通过微调 Stable Diffusion 实现原生日语提示词生成。该模型利用约 1 亿张带日语字幕图像训练,采用两阶段 PITI 方法优化文本编码器,能准确理解日本文化、俚语及拟声词。模型已上线 Hugging Face 和 GitHub,代码基于 🧨 Diffusers。
Hugging Face 上线 Evaluation on the Hub,基于 AutoTrain 实现无需代码的零样本分类评估。该工具已升级基础设施,支持免费评估参数量达 66 billion 的大模型,处理 2000 条样本仅需 3.5 小时。
Hugging Face AutoTrain 正式支持计算机视觉中的图像分类任务,用户无需编写代码即可训练模型。该功能允许上传本地数据或使用 Hub 数据集,AutoTrain 会自动尝试多个候选模型并优化资源,示例中最佳模型达到 84% 准确率。小规模训练(如少于 500 张图片)可免费使用,训练后的模型可直接在 Hub 上通过推理组件测试。
Hugging Face Accelerate 利用 PyTorch meta device 创建空模型并自动计算设备映射,从而在有限内存下加载 OPT-6.7B 等大语言模型。该方案通过分块加载权重至 GPU、CPU 或磁盘,避免了传统方法中因同时持有模型结构与权重副本导致的内存溢出问题。
Hugging Face 联合 Intel Labs 和 UKP Lab 推出 SetFit,一种用于 Sentence Transformers 少样本微调的高效框架。
推荐理由:原文提供了 SetFit 框架的原理、基准测试对比及代码示例,读者可据此了解如何在少量标注数据下高效微调 Sentence Transformers。
Hugging Face 推出首期“伦理与社会”通讯,旨在探讨如何将协作、责任与透明等价值观融入 AI 开发。该通讯由跨部门非专职团队编写,计划每季发布一次,分享关于可审计性、文档规范及社区反馈机制的实践思考。
Hugging Face 展示利用 DeepSpeed-Inference 与 Accelerate 在 8x80GB A100 GPU 上实现 BLOOM 176B 模型的高吞吐推理。
Hugging Face 发布 Diffusers 库 v0.3 版本,正式引入 Image-to-Image 管线、Textual Inversion 个性化训练工具以及实验性的 Inpainting 修复功能。
推荐理由:Diffusers v0.3 集中上线了图生图、文本反转及小显存优化等核心功能,显著降低了 Stable Diffusion 的本地部署与个性化创作门槛。
Hugging Face 发布教程,指导用户利用 🤗 transformers Trainer 和自定义 Data Collator,在 Google Colab 上从零训练 Offline Decision Transformer。该模型基于 GPT-2 架构,将强化学习转化为序列建模问题,通过条件生成动作实现 Gym HalfCheetah 环境中的离线 RL 任务。
Hugging Face 发布教程,指导在 NVIDIA GPU 上使用 Megatron-LM 框架训练 GPT2 模型并转换为 🤗 Transformers 格式。Megatron-LM 通过高效 DataLoader、Fused CUDA Kernels 及 Apex Fused AdamW 优化器提升训练速度。该流程涵盖环境搭建、CodeParrot 数据预处理、模型训练及转换步骤。
Hugging Face 支持由 RAIL Initiative 推出的 OpenRAIL 许可框架,旨在为 AI 模型提供兼顾开放访问与负责任使用的专用许可证。该框架允许免版税使用及分发衍生作品,同时嵌入基于证据的使用限制条款,禁止在特定高风险场景中使用模型。OpenRAIL 试图解决传统开源许可证无法有效管控 ML 模型社会伦理风险的问题,推动 AI 开发的规范化治理。
Hugging Face Blog 介绍了在 Hugging Face Spaces 中使用 Gradio 和 3Dmol.js 可视化蛋白质结构的方法。开发者可通过 iframe 集成 3Dmol.js,支持输入 PDB 代码或上传文件以展示 AlphaFold2 等模型预测的蛋白质三维结构。
Hugging Face 发布教程,指导用户通过 🧨 Diffusers 库(版本 0.10.2)运行 Stable Diffusion v1-4 模型进行文本到图像生成。
推荐理由:原文结合代码演示与架构解析,展示了如何使用 Diffusers 库运行 Stable Diffusion v1-4 并自定义推理流程。
Hugging Face 发布教程,指导用户利用 AWS DL1 实例上的 Habana Gaudi 芯片,通过掩码语言建模任务从头预训练 BERT-base 模型。该流程结合 Transformers、Optimum Habana 和 Datasets 库,涵盖数据集准备、Tokenizer 训练及预处理步骤,旨在发挥 Gaudi 的成本效益优势。
Hugging Face 演示如何将 ViT B/16 模型部署至 Google Cloud Vertex AI,实现比 Kubernetes 更简洁的代码与同等扩展性。该流程利用 `google-cloud-aiplatform` SDK 完成模型上传、端点创建及预测请求,支持自动扩缩容、版本管理及流量分割等托管功能。
Hugging Face Optimum Graphcore 库支持在 Graphcore IPU 上高效微调预训练 Vision Transformer (ViT) 模型。该方案利用 IPU 的并行架构优势,通过加载 ImageNet-21k 预训练的 ViT 检查点,可快速完成如 ChestX-ray14 数据集的分类任务,显著缩短 AI 模型开发周期并提升计算效率。
Hugging Face 发布博客文章,详细介绍如何将 LLM.int8() 技术集成到 transformers 和 accelerate 库中,以实现大语言模型的 8-bit 量化推理。该技术在保持 BLOOM-176B 等大模型性能零衰减的前提下,将显存需求减半,并提供了从原理分析、基准测试对比到具体代码实现的完整教程。
推荐理由:原文详解了LLM.int8()在transformers中的集成原理与代码实现,提供了降低大模型显存占用且不损失精度的具体方法。
Hugging Face 发布新库 Skops,允许用户将 scikit-learn 模型托管至 Hub 并创建模型卡片。该工具通过 `hub_utils.init` 初始化本地仓库,利用 `Card` 类自动生成包含超参数、交互式图表及评估指标的文档。Skops 旨在简化开源机器学习中的模型复现、解释性及协作流程。
Hugging Face 强调在 TensorFlow 中应优先使用 Keras 高层 API,而非绕过它。通过 `TFAutoModel` 等类,用户可一行代码加载 BERT、ViT 等预训练模型并应用迁移学习。该策略旨在利用 `tf.data` 和 Keras 生态简化模型构建与训练流程。
Hugging Face 展示了如何使用 Docker 和 Kubernetes 扩展 🤗 ViT 模型的 TensorFlow Serving 本地部署。该方案通过容器化 SavedModel 并配置 gRPC 请求处理,实现了支持多用户的高可用服务架构。
Hugging Face 指出该教程已过时,当前应使用 `SentenceTransformerTrainer` API。文中演示了基于 `distilroberta-base` 构建模型及加载 `all-MiniLM-L6-v2` 进行微调的方法。相比原生 BERT,Sentence Transformers 将万句语义搜索耗时从约 65 小时降至 5 秒。
Hugging Face 在深度强化学习课程中详解 Proximal Policy Optimization (PPO) 算法,通过裁剪概率比率至 [1−ϵ,1+ϵ] 范围限制策略更新幅度以提升训练稳定性。文章对比了 TRPO 方法,并指导使用 PyTorch 从零构建 PPO Agent,在 CartPole-v1 和 LunarLander-v2 环境中验证实现效果。
Hugging Face 发布 Private Hub,提供从研究到生产的安全合规统一工具集,解决约 90% 模型无法投产及内部重复开发痛点。该方案整合了拥有 60K+ 模型、6K 数据集和 6K 应用的 Hugging Face Hub,支持 Git 版本控制与组织协作。注:2023 年 6 月该产品已更名为 Enterprise Hub,转为 SaaS 托管服务并停止私有化部署。
Nyströmformer利用Nyström方法将Transformer自注意力的复杂度从O(n²)降至O(n)。该模型通过查询和键的段均值采样32或64个landmarks来近似softmax矩阵,在长序列(n=4096或8192)上保持与标准自注意力相当的竞争力性能。
Hugging Face 向白宫科技政策办公室和 NSF 提交关于 NAIRR 实施路线图的回应,支持其努力并提出五项建议。核心主张包括任命具备伦理创新记录的技术专家为顾问、采用 Model Cards 等文档标准、通过 AutoTrain 等低代码工具降低使用门槛、监控开源滥用风险以及提供多语言资源以赋能跨学科研究者。
Hugging Face 为 🤗 Datasets 库发布音频和图像数据集的新文档,更新 Quickstart 并引入 `to_tf_dataset` 函数以简化 TensorFlow 数据加载。新增的 `ImageFolder` 构建器允许用户无需编写脚本即可通过文件夹结构直接加载图像分类、描述及目标检测数据集。
🤗 transformers 库现已支持使用 XLA 编译 TensorFlow 文本生成模型,速度提升高达 100x,甚至快于 PyTorch。该功能基于 GPT-2 等模型演示了采样、Beam Search 及温度控制等生成策略,需 transformers >= 4.21.0 版本。
Hugging Face 团队演示如何利用 TF Serving 本地部署 Vision Transformer (ViT) 图像分类模型,支持 REST 和 gRPC 端点。
Hugging Face 在深度强化学习课程中介绍 Advantage Actor Critic (A2C),该混合架构结合基于策略的 Actor 和基于价值的 Critic,旨在解决 Reinforce 算法因蒙特卡洛采样导致的高方差问题。
Hugging Face 博客以 MNIST 手写数字识别为例,演示了动态对抗数据收集(DADC)流程。通过 🤗 Spaces 让用户绘制数字欺骗模型并标记样本,再将其用于重新训练以提升鲁棒性。文中展示了基于 PyTorch 的卷积网络配置及 Gradio 内置的 flagging 回调功能。
Hugging Face 公布 176B 参数多语言模型 BLOOM 的训练工程细节。该模型基于 GPT3 架构,在 Jean Zay 超算上利用 384 张 NVIDIA A100 80GB GPU,通过 Megatron-DeepSpeed 框架耗时 3.5 个月完成训练。项目处理了涵盖 46 种语言的 350B tokens 数据集,实现了大规模分布式并行训练的技术突破。
基于 `sentence-transformers/msmarco-MiniLM-L-6-v3` 模型将歌词按段落分块并生成嵌入向量,通过语义搜索匹配提示词以构建歌单。利用 Gradio Blocks API 封装多步交互应用并托管于 Hugging Face Spaces,实验显示设置 `top_k=20` 时通常能获取至少 9 首不同歌曲。
Hugging Face 联合 BigScience 项目正式发布拥有 176 billion 参数的多语言大模型 BLOOM,支持生成 46 种自然语言和 13 种编程语言文本。
推荐理由:原文披露了BLOOM的176B参数规模、多语言能力及训练透明度细节,为研究者提供了评估大规模开源模型性能与内部机制的具体基准。
Hugging Face 发布 Twitter 情感分析指南,介绍如何利用 Inference API 对推文进行正负中性分类。该方案支持通过 Tweepy 获取数据并实时处理,旨在帮助企业规模化监测品牌舆情与用户反馈。
Hugging Face 发布深度强化学习课程第5单元,讲解如何使用 PyTorch 从零实现 Reinforce 算法。该策略梯度方法直接优化策略而非价值函数,支持随机策略并适用于高维或连续动作空间。文章对比了其与 Deep Q-Learning 的优劣,并在 CartPole-v1、PixelCopter 和 Pong 环境中测试其鲁棒性。
Hugging Face 发布教程指导新手利用 Sentence Transformers 库完成首个机器学习项目。该库能将文本转化为向量,通过余弦相似度实现语义搜索与聚类,GitHub 星标近 8000。文章分享了从头脑风暴到数据源选择的实战策略,帮助开发者快速上手嵌入模型应用。