如何在 AWS 上部署和微调 DeepSeek R1 模型
Hugging Face 联合 AWS 提供在云端部署与微调 DeepSeek R1 及蒸馏模型的指南。开发者可通过 Inference Endpoints、SageMaker AI 或 Bedrock Marketplace 运行模型,其中 DeepSeek R1 推理成本为每小时 8.3 美元。
Hugging Face 联合 AWS 提供在云端部署与微调 DeepSeek R1 及蒸馏模型的指南。开发者可通过 Inference Endpoints、SageMaker AI 或 Bedrock Marketplace 运行模型,其中 DeepSeek R1 推理成本为每小时 8.3 美元。
Hugging Face 宣布在 Hub 模型页面及客户端 SDK 中正式集成 fal、Replicate、Sambanova 和 Together AI 四家 Serverless 推理提供商。用户可通过自定义 API Key 直连或经 HF 路由两种模式调用 DeepSeek-R1 等模型,PRO 用户每月获 $2 跨提供商通用额度。
推荐理由:原文展示了在 Hub 模型页直接调用多家第三方 Serverless 推理服务的统一入口与计费模式,为开发者提供了更灵活的模型部署选择。
NVIDIA 发布 Python 工具包 KVPress,通过集成 KnormPress、SnapKVPress 等先进算法压缩 KV Cache,解决长上下文内存瓶颈。该方案支持在 transformers 库中结合量化技术,显著降低如 Llama 3-70B 处理 1M tokens 时高达 327.6GB 的显存需求,助力高效部署大语言模型。
Hugging Face 与 FriendliAI 达成合作,将 Friendli Endpoints 作为部署选项集成至 Hugging Face Hub。开发者可通过“Deploy this model”按钮一键部署模型至 NVIDIA H100 GPU,利用连续批处理、原生量化及自动扩缩容技术实现高性能低成本推理。
Hugging Face 推出 TGI Backends 架构,允许通过统一前端集成 vLLM、TensorRT-LLM 等推理引擎。该方案利用 Rust 重构 HTTP 与调度层以规避 Python GIL 限制,提升并发性能。计划于 2025 年第一季度集成 vLLM,并持续扩展对 NVIDIA、AWS 及 Google TPU 等硬件的支持。
Hugging Face 发布教程指导如何使用 PyTorch 内置工具可视化训练过程中的 GPU 显存占用。文章详细解析了模型参数、优化器状态、激活值等组件的显存构成,并提供了一套估算总显存需求的数学公式及启发式方法。
推荐理由:文章拆解了PyTorch显存快照工具的使用,并给出了基于模型参数和激活值的显存估算公式,有助于开发者定位训练中的内存瓶颈。
NVIDIA 推出 LogitsProcessorZoo,这是一套专为控制序列长度、强制关键短语及引导多选题答案设计的模块化 logits 处理器。该库完全兼容 Hugging Face Transformers 的 generate 方法,允许用户通过直接修改概率分布来精细调控大语言模型的文本生成行为。
Hugging Face 在 Google Cloud C4(第 5 代 Xeon)与 N2(第 3 代 Xeon)实例上对比文本嵌入和生成性能。C4 的文本嵌入吞吐量比 N2 高 10x 至 24x,文本生成高 2.3x 至 3.6x。考虑价格因素后,C4 在两项任务中分别保持 7x~19x 和 1.7x~2.9x 的 TCO 优势,证明轻量级 Agentic AI 可完全部署于 CPU。
Hugging Face 宣布其 83 个开源模型现已在 Amazon Bedrock Marketplace 上架,底层由 SageMaker JumpStart 管理。
Capital Fund Management (CFM) 结合 Hugging Face Inference Endpoints 与 Argilla,利用 Llama 3.1-70b-Instruct 辅助标注数据并微调 GLiNER 和 SpanMarker 等小型模型。
Hugging Face Xet 团队重新设计 Hub 上传下载架构,引入内容寻址存储(CAS)以突破现有限制。新协议采用“智能写入、简单读取”理念,在字节级分析文件以优化去重与压缩,预计可将 Safetensors 等张量文件的上传速度提升 10-25%。该方案旨在解决大模型权重传输瓶颈,并为全球用户提供更低延迟和更安全的审计追踪。
Hugging Face 博客深入解析了 LayerSkip 提出的自推测解码技术,该方法利用大语言模型的早期层生成草稿 token,并由深层进行验证,从而加速文本生成并节省内存。
Hugging Face Xet 团队采用内容定义分块(CDC)技术,仅传输修改后的数据块以优化 Git LFS 存储。在 CORD-19 数据集基准测试中,该方案使平均下载时间从 51 分钟降至 19 分钟,存储占用从 8.9 GB 减至 3.52 GB。预计对 PyTorch 检查点实现 50% 去重率,可节省高达 100 TB 存储空间,计划于 2025 年初推出基于 Xet 的仓库。
Mistral AI 推出 Batch API,处理高容量请求的成本比同步 API 低 50%。该功能已在 La Plateforme 上线,支持所有模型,适用于文档摘要、向量嵌入及数据标注等场景。每个工作区限制 100 万个进行中请求。
Intel Labs 和 Hugging Face 共同开发了 Universal Assisted Generation (UAG),该方法扩展了辅助生成技术,使其能够使用来自任何模型家族的小型语言模型作为助手。
Hugging Face 指导利用 Optimum-Intel 与 OpenVINO GenAI 将 meta-llama/Meta-Llama-3.1-8B 导出为 IR 格式并优化。通过 NNCF 框架支持 INT4/INT8 权重量化,结合 AWQ 等技术降低边缘设备延迟。该方案简化了 C++ 或 Python 环境下的 LLM 推理集成,实现高效低依赖部署。
Hugging Face 演示如何在 Google Cloud Vertex AI 上部署 Meta Llama 3.1 405B FP8 量化模型。该方案利用配备 8 张 H100 GPU 的 A3 节点及 Text Generation Inference (TGI) 容器,支持通过代码或 Hub 直接调用进行在线推理。
Mistral AI 在 La Plateforme 上线模型定制功能,支持对 Mistral Large 2 和 Codestral 进行微调。同时推出 Agents Alpha 版本,允许通过指令和示例构建自定义工作流。此外,mistralai 客户端 SDK 发布 1.0 稳定版,覆盖 Python 和 TypeScript。
Hugging Face 官方博客发布教程,指导如何使用 Quanto 工具对 Diffusers 库中的 Transformer 架构扩散模型进行量化,以显著降低显存需求。
Hugging Face 联合 NVIDIA 推出基于 NIM 的 Serverless Inference API,支持 Enterprise Hub 用户通过 OpenAI 兼容接口调用 Llama、Mistral 等开源模型。该服务运行于 NVIDIA H100 GPU,采用按请求时长计费模式,例如 Meta-Llama-3-8B-Instruct 单次请求约 $0.0023。
Hugging Face 为 Text Generation Inference (TGI) 推出 Multi-LoRA serving 功能,支持在单次部署的基础模型上动态加载并服务多达 30 个 LoRA 适配器。
推荐理由:TGI 新增 Multi-LoRA 功能,允许在单一基础模型部署中动态加载多个微调适配器,显著降低多模型服务的运维成本与复杂度。
Hugging Face 宣布在其 Inference Endpoints 和 Spaces 中正式支持 Google Cloud TPUs。用户现在可以选择 TPU v5e 实例(v5litepod-1/4/8)来部署模型,每小时价格从 $1.375 到 $11.00 不等。
ProtST 蛋白质语言模型在 Intel Gaudi 2 上实现高效推理与微调。借助 Optimum for Intel Gaudi 库,其零样本推理速度比 NVIDIA A100 快 1.76 倍且精度一致;微调任务中单卡 Gaudi 2 较 A100 提速 2.92 倍,多卡训练可线性扩展。
Hugging Face 宣布其 Amazon SageMaker Embedding Container 正式可用,支持在 SageMaker 上高效部署嵌入模型以构建 RAG 应用。该容器基于 Text Embedding Inference (TEI) 技术,兼容 BERT、RoBERTa 等架构及 Snowflake Arctic 等开源模型。
Hugging Face 在 Optimum Habana 中为 Intel Gaudi 处理器适配并优化了辅助生成功能,利用推测采样技术实现文本生成加速。该方法通过草稿模型生成 token 并由目标模型验证,可为大型 Transformer 模型带来约 2 倍的推理速度提升,同时保持与自回归采样一致的输出质量。
Hugging Face 发布 Text Generation Inference (TGI) 的配套基准测试工具,旨在超越单纯吞吐量指标,帮助开发者通过权衡延迟与吞吐来调优 LLM 部署。该工具支持在 Hugging Face Space 中运行,提供预填充统计及 TTFT、Latency 等关键性能可视化分析,适用于不同用户场景下的推理服务优化。
Hugging Face 宣布支持在 AWS Inferentia2 上部署超过 10 万个模型,新增 14 种架构和 6 类任务。Inference Endpoints 推出 Inf2-small($0.75/小时)和 Inf2-xlarge($12/小时)实例,适配 Llama 3 8B 与 70B。
Hugging Face 与 AMD 合作,使 AMD Instinct MI300 GPU 在 Hugging Face 平台获得一等公民集成。用户无需修改代码即可通过 transformers 和 text-generation-inference (TGI) 部署模型。
Hugging Face Spaces 发布 Dev Mode,允许开发者通过 VS Code 或 SSH 直接连接并编辑代码,无需 git push。该功能目前处于 beta 阶段,仅对 PRO 订阅用户开放。
Hugging Face 与 Dell 联合发布 Dell Enterprise Hub,将开源大语言模型的本地训练与部署时间从数周缩短至几分钟。该中心提供 Llama 3、Mixtral 和 Gemma 等模型,支持通过脚本自动部署为 API 端点,并兼容 OpenAI Messages API。
Hugging Face 在 Transformers 库中推出了 KV Cache 量化功能,通过降低键值缓存的精度来显著减少长文本生成的内存占用。该功能支持 int2、int4 和 int8 精度,其中 int4 量化在几乎不损失模型质量的情况下可实现约 2.5 倍的显存节省。
Intel 利用 OPEA 平台,结合 LangChain、BAAI/bge-base-en-v1.5 嵌入模型及 Redis,在 Granite Rapids CPU 和 Gaudi 2 加速器上部署企业级 RAG 应用。
Hugging Face 通过自定义推理处理器在 Inference Endpoints 上集成 Whisper ASR、Pyannote 说话人分离及推测解码。该方案利用 PyTorch 2.2 Flash Attention 加速,支持单 API 端点调用多模型组合。用户可配置助手模型以启用推测解码,需满足特定架构与 batch size=1 限制。
Gradio 推出 reload mode,通过 `gradio app.py` 启动即可在不重启服务器、不重新加载模型的情况下实时预览 UI 变更。该模式利用 `if gr.NO_RELOAD:` 标记保护模型加载逻辑,解决了传统开发中因重载导致的延迟问题。
Zama 利用 Hugging Face Endpoints 和自定义推理处理器,实现 Concrete ML 全同态加密(FHE)模型的云端一键部署。用户可通过 CPU 实例运行预编译模型,在数据加密状态下完成推理以保障隐私。该方案目前依赖 Python 3.10 环境,支持 scikit-learn、PyTorch 等框架的模型转换与调用。
Hugging Face 联合 Google Cloud 发布“Deploy on Google Cloud”集成,允许开发者通过 Vertex AI 或 GKE 将数千个基础模型部署为 API Endpoint。
Hugging Face 展示如何利用 🤗 Optimum Intel 将 SetFit 模型在 Intel Xeon CPU 上的推理速度提升 7.8 倍。该方案采用静态后训练量化(PTQ),仅需少量无标签校准数据即可降低内存占用并保留精度,无需重新训练。这为基于 Sentence Transformers 的少样本微调框架提供了生产级部署的高效路径。
Hugging Face 与 Cloudflare 合作推出 Deploy on Cloudflare Workers AI 集成,允许开发者通过无服务器 API 调用 Llama、Mistral 等开源模型。
Hugging Face 利用 Optimum Intel 库对 Microsoft Phi-2 模型进行 4-bit 量化,并在搭载 Core Ultra 7 155H CPU 的 Intel Meteor Lake 笔记本上成功运行。该方案结合硬件加速与小语言模型优势,实现了本地低延迟、高隐私的 LLM 推理体验。
Hugging Face 推出 Quanto,这是 Optimum 框架下的 PyTorch 量化后端。它支持 int2、int4、int8 和 float8 权重及激活,兼容 CUDA 与 MPS 设备,并集成于 transformers 库中。该工具旨在简化大语言模型及其他模态模型的量化流程,降低部署内存成本。