跳到正文

#Hugging Face

今日 0 条
6月24日周一
6月20日周四
6月19日周三
6月18日周二
6月13日周四
6月12日周三
  1. Hugging Face Blog82

    Hugging Face 集成 Stable Diffusion 3 Medium 模型

    Stable Diffusion 3 Medium(2B 参数)已上线 Hugging Face Hub 并支持通过 🧨 Diffusers 库使用。该模型采用多模态扩散 Transformer (MMDiT) 架构和 Rectified Flow Matching 训练目标,引入了新的 FlowMatchEulerDiscreteScheduler 调度器。

    推荐理由:官方给出了 SD3 Medium 的架构细节、显存优化方案及微调脚本,开发者可据此评估其在不同硬件上的部署可行性。

6月7日周五
6月6日周四
6月5日周三
6月4日周二
5月31日周五
  1. Hugging Face Blog62

    Hugging Face 披露 Spaces 密钥泄露事件并实施安全整改

    Hugging Face 团队检测到对 Spaces 平台的未授权访问,怀疑部分 Spaces secrets 被非法获取。作为补救第一步,官方已撤销相关 HF tokens 并通知受影响用户,建议刷新密钥并切换至新的默认细粒度访问令牌。

    推荐理由:Hugging Face 披露 Spaces 密钥泄露事件及补救措施,用户需立即轮换令牌并启用细粒度访问权限以保障账户安全。

5月29日周三
  1. Mistral AI83

    Mistral AI 发布首个代码生成模型 Codestral

    Mistral AI 推出其首个专为代码生成设计的开放权重模型 Codestral。该模型参数量为 22B,支持 80 多种编程语言,拥有 32k 上下文窗口,并在 RepoBench 等长程代码生成评测中表现优于竞品。

    推荐理由:官方详细披露了 Codestral 的架构参数、多语言支持及基准测试数据,并明确了非生产许可与商业授权路径,为开发者评估其实际编码能力提供了完整依据。

  2. Hugging Face Blog42

    Hugging Face 推出 TGI Benchmarking 工具以优化 LLM 推理部署

    Hugging Face 发布 Text Generation Inference (TGI) 的配套基准测试工具,旨在超越单纯吞吐量指标,帮助开发者通过权衡延迟与吞吐来调优 LLM 部署。该工具支持在 Hugging Face Space 中运行,提供预填充统计及 TTFT、Latency 等关键性能可视化分析,适用于不同用户场景下的推理服务优化。

5月28日周二
  1. Hugging Face Blog55

    Sentence Transformers 嵌入模型微调与训练指南

    Hugging Face 发布 Sentence Transformers 库中嵌入模型的微调与训练指南,详解数据集、损失函数、训练参数及评估器等核心组件。文章演示了如何使用 SentenceTransformerTrainer 进行单数据集及多数据集混合训练,并介绍了自动生成的模型卡片功能以记录训练细节和评估结果。

5月24日周五
  1. Hugging Face Blog68

    TII 发布 Falcon 2 11B LLM 和 VLM 模型

    TII 发布 Falcon 2 系列新模型,包含 11B 参数的基础大语言模型(LLM)和支持图像理解的视觉语言模型(VLM)。

    推荐理由:原文给出了11B参数模型的训练数据规模、架构细节及在英语和多语言基准上的具体评测分数,读者可据此评估其性能与开源可用性。

5月22日周三
5月21日周二
5月16日周四
5月14日周二
  1. Hugging Face Blog82

    谷歌发布开源视觉语言模型 PaliGemma

    谷歌推出开源视觉语言模型家族 PaliGemma,采用 SigLIP-So400m 作为图像编码器、Gemma-2B 作为文本解码器。该模型支持图像与文本输入并输出文本,提供预训练(PT)、混合任务微调(Mix)及特定基准微调(FT)三类检查点,涵盖 224x224、448x448、896x896 三种分辨率及多种精度格式。

    推荐理由:原文详细拆解了PaliGemma的架构组成与推理流程,并提供了基于Transformers的微调代码示例,适合开发者快速上手该开源视觉语言模型。

  2. Hugging Face Blog29

    Hugging Face 推出 Open Arabic LLM Leaderboard

    Hugging Face 推出 Open Arabic LLM Leaderboard (OALL),旨在评估阿拉伯语大语言模型性能,服务全球超 3.8 亿使用者。该榜单整合 AlGhafa、ACVA 等基准数据集,采用归一化对数似然准确率作为核心指标,并基于 lighteval 库实现开箱即用的评测支持。

5月13日周一
  1. Hugging Face Blog75

    Hugging Face 发布 Transformers Agents 2.0 及独立库 smolagents

    Hugging Face 发布 Transformers Agents 2.0,引入基于过去观察迭代解决复杂任务的新智能体类型,并将该模块升级为独立库 smolagents。新框架强调代码清晰性与模块化,支持社区共享选项,实测显示基于 Llama-3-70B-Instruct 的智能体在 GAIA Leaderboard 上超越了多个 GPT-4 基线智能体。

    推荐理由:官方展示了新框架在GAIA基准测试中超越GPT-4智能体的实测数据,并提供了从Transformers迁移到独立库smolagents的清晰路径。

5月9日周四
5月5日周日
5月3日周五
  1. Hugging Face Blog60

    Hugging Face 上线 Artificial Analysis LLM 性能排行榜

    Hugging Face 正式集成 Artificial Analysis LLM Performance Leaderboard,覆盖超过100个 serverless LLM API 端点。该榜单综合评估模型的质量(基于 MMLU、HumanEval 等)、上下文窗口、定价及推理速度(吞吐量与延迟),支持不同提示长度和并行查询场景下的性能对比。

    推荐理由:Hugging Face 引入 Artificial Analysis 排行榜,整合了超过100个API端点的价格、速度和质量数据,为工程师选型提供多维参考。

5月1日周三
4月30日周二
4月29日周一
  1. Hugging Face Blog61

    Hugging Face 发布 StarCoder2-15B-Instruct-v0.1:首个全透明自对齐代码大模型

    Hugging Face 发布 StarCoder2-15B-Instruct-v0.1,这是首个采用完全宽松且透明管道训练的自对齐代码 LLM。该模型利用 StarCoder2-15B 自身生成指令和响应进行微调,在 HumanEval 上取得 72.6 分,超越了 CodeLlama-70B-Instruct。

    推荐理由:展示了完全自对齐的代码模型训练流程,提供了无需蒸馏专有模型即可达到高性能的开源方案。

4月23日周二
4月22日周一
4月19日周五
4月18日周四
  1. Hugging Face Blog92

    Meta 发布 Llama 3 开源大语言模型

    Meta 正式发布 Llama 3 系列开源大语言模型,包含 8B 和 70B 两种参数规模,均提供基础版和指令微调版。该模型采用新 tokenizer 将词汇表扩展至 128,256,并在超过 15 万亿 tokens 的数据上进行了预训练。

    推荐理由:原文详细列出了 Llama 3 的模型规格、训练数据量及在 Hugging Face 生态中的集成方式,为开发者提供了从本地部署到云端推理的具体技术路径。

4月16日周二