跳到正文

#开源生态

今日 0 条
9月27日周三
  1. Mistral AI86

    Mistral AI 发布 Mistral 7B 开源模型

    Mistral AI 发布 Mistral 7B,这是一个拥有 7.3B 参数的语言模型,采用 Apache 2.0 许可证完全开源。该模型在所有基准测试中均优于 Llama 2 13B,在许多基准上超过 Llama 1 34B,并使用分组查询注意力(GQA)和滑动窗口注意力(SWA)以加速推理和处理长序列。

    推荐理由:原文给出了 Mistral 7B 在多项基准上超越 Llama 2 13B 的实测数据及 Apache 2.0 开源许可,读者可据此评估小参数模型的性价比与部署可行性。

  2. Mistral AI82

    Mistral AI 发布 Mistral 7B 并倡导开放模型

    Mistral AI 发布其首个 70 亿参数模型 Mistral 7B,该模型在所有标准英语和代码基准测试中超越了目前可用的所有高达 130 亿参数的开源模型。公司以 Apache 2.0 许可证开源该模型,旨在通过社区驱动的开放权重方法构建对 AI 寡头的可信替代方案。Mistral AI 承诺将持续发布缩小与黑盒模型性能差距的新模型,并同步推进商业专有模型及托管解决方案的开发。

    推荐理由:Mistral AI 阐述开放权重模型对抗闭源垄断的理念,并发布首个超越同量级开源模型的 Mistral 7B。

9月22日周五
9月18日周一
  1. Hugging Face Blog38

    Hugging Face 发布目标检测排行榜及评估指标详解

    Hugging Face 推出 Object Detection Leaderboard,对 Hub 上的开源目标检测模型进行排名。该博客深入解析 IoU、Average Precision (AP) 和 Average Recall (AR) 等核心评估指标的计算方法。文章旨在帮助开发者理解不同报告间结果差异的原因,从而更批判性地评估模型性能并选择最适合应用需求的模型。

9月11日周一
9月6日周三
  1. Hugging Face Blog82

    Hugging Face 上线 TII Falcon 180B 开源大模型

    TII 发布的 Falcon 180B 正式登陆 Hugging Face Hub,提供 base 和 chat 版本。该模型拥有 1800 亿参数,基于 RefinedWeb 数据集在 3.5 万亿 tokens 上完成预训练,是当时最大的公开可用语言模型。其性能在多项基准测试中超越 Llama 2 70B,接近 PaLM-2 Large,但商用许可对托管使用有严格限制。

    推荐理由:原文给出了 Falcon 180B 的参数量、训练数据规模及硬件需求,读者可据此评估其在开源大模型中的性能定位与部署门槛。

8月25日周五
  1. Hugging Face Blog86

    Hugging Face 发布 Code Llama 集成支持

    Hugging Face 宣布在生态系统中集成 Meta 发布的 Code Llama 模型系列,提供 transformers 4.33+ 支持、Text Generation Inference 部署及 VS Code 扩展。

    推荐理由:原文给出了 Code Llama 在 Hugging Face 生态中的集成方式、不同参数规模的能力差异以及具体的部署与微调建议,读者可以据此判断如何将其接入现有开发工作流。

8月22日周二
  1. Hugging Face Blog70

    Hugging Face 发布开源视觉语言模型 IDEFICS

    Hugging Face 推出开源视觉语言模型 IDEFICS,作为 DeepMind Flamingo 的公开复现版本。该模型提供 9B 和 80B 参数两种规模及指令微调变体,支持图文交错输入与文本生成。训练数据包含新创建的 115B token 数据集 OBELICS,模型权重在 Hugging Face Hub 上线并集成至 transformers 库。

    推荐理由:原文公开了基于 Flamingo 架构的开源复现细节及 OBELICS 数据集,为社区提供了可验证的多模态大模型训练基准。

  2. Hugging Face Blog40

    Hugging Face 推出企业级代码助手 SafeCoder

    Hugging Face 发布 SafeCoder,这是一款基于 StarCoder 模型的企业级自托管代码助手解决方案。该方案允许客户在自有基础设施上微调专有代码库,确保数据在训练和推理期间不离开 VPC。SafeCoder 支持 NVIDIA、AMD 等多种硬件加速部署,旨在提供合规且私有的“内部 GitHub Copilot”体验。

8月8日周二
  1. Hugging Face Blog73

    Hugging Face 发布 Swift Transformers 等工具以支持在苹果设备运行 LLM

    Hugging Face 发布 swift-transformers、swift-chat 及更新的模型导出工具,旨在帮助开发者在 Mac 和 iPhone 等苹果设备上通过 Core ML 运行 Llama 2 等大语言模型。

    推荐理由:原文提供了在苹果设备上运行大语言模型的完整工具链和转换指南,开发者可据此评估本地化部署的可行性。

7月24日周一
  1. Hugging Face Blog40

    Hugging Face 联合发布欧盟 AI 法案开放机器学习考量立场文件

    Hugging Face 与 Creative Commons、Eleuther AI、GitHub、LAION 及 Open Future 联合发布立场文件,阐述开放 ML 开发对欧盟 AI 法案目标的支持作用。该文件提出五项建议,包括明确定义 AI 组件、澄清开源协作开发不受法案约束、支持 AI Office 与开源生态协调、确保 R&D 例外实用性以及为“基础模型”设定比例要求。

7月18日周二
6月23日周五
  1. Hugging Face Blog65

    Hugging Face 解析 Open LLM Leaderboard 中 MMLU 评分差异原因

    Hugging Face 团队分析了 Open LLM Leaderboard 上 MMLU 分数与论文数据不一致的原因,指出不同评估实现导致结果显著差异。文章对比了 EleutherAI Harness、Stanford HELM 和原始实现三种方法在提示词构造及概率计算上的区别,展示了同一模型在不同方法下的得分变化。最终确认社区维护的评估库更新后已对齐原始实现,并将重新运行排行榜以修正数据。

    推荐理由:原文通过对比三种 MMLU 实现方式,揭示了评估细节对模型分数的巨大影响,为理解 LLM 评测差异提供了具体案例。

6月16日周五
6月13日周二
  1. Hugging Face Blog45

    Hugging Face 与 AMD 合作加速 CPU 和 GPU 平台上的前沿模型

    Hugging Face 宣布 AMD 加入其硬件合作伙伴计划,双方将合作优化 AMD CPU 和 GPU 上的 Transformer 性能。初期测试显示,AMD MI250 训练 BERT-Large 速度比直接竞争对手快 1.2 倍,GPT2-Large 快 1.4 倍。该合作旨在通过 ROCm SDK 集成及新 Optimum 库,为社区提供更具成本效益的训练与推理方案。

6月12日周一
  1. Hugging Face Blog28

    Hugging Face Hub 面向画廊、图书馆、档案馆和博物馆的使用指南

    Hugging Face Hub 为 GLAM 领域提供模型、数据集及演示应用的共享平台,目前托管超 190,000 个模型与 33,000 个数据集。机构可通过按任务(如 token-classification)和语言筛选查找现成模型,并利用 Spaces 快速部署 Gradio 或 Docker 应用。文章还演示了如何将 CSV 格式的数据集上传至 Hub 以支持文本分类等任务。

6月6日周二
6月5日周一
  1. Hugging Face Blog84

    Falcon 系列大语言模型正式登陆 Hugging Face 生态

    阿布扎比技术创新研究所(TII)发布的 Falcon 系列开源大语言模型已全面集成至 Hugging Face 生态系统。该系列包含 Falcon-7B 和 Falcon-40B 两个基础版本及对应的指令微调版,均采用 Apache 2.0 许可证并支持商业使用。

    推荐理由:原文详细展示了 Falcon 模型在 Hugging Face 生态中的推理、量化及微调全流程,为开发者提供了可直接复用的工程实践指南。

6月1日周四
5月24日周三
5月23日周二
  1. Hugging Face Blog62

    Safetensors 通过安全审计并将成为 Hugging Face 默认模型格式

    Hugging Face、EleutherAI 和 Stability AI 联合委托 Trail of Bits 对 safetensors 库进行的外部安全审计已完成,结果显示未发现导致任意代码执行的关键安全漏洞。

    推荐理由:原文披露了 safetensors 通过外部安全审计的结果及成为默认格式的路径,读者可据此评估模型加载的安全性与性能收益。

5月15日周一
4月26日周三
4月24日周一
3月23日周四
3月9日周四
  1. Hugging Face Blog82

    Hugging Face 发布 TRL 与 PEFT 集成指南:在 24GB GPU 上微调 20B LLM

    Hugging Face 正式发布了 trl 库与 peft 库的集成方案,使得用户能够在单张 24GB 消费级 GPU(如 NVIDIA 4090)上对 20B 参数的大语言模型进行基于强化学习的人类反馈(RLHF)微调。该方案通过结合 8-bit 量化加载、低秩适配器(LoRA)以及共享参考模型权重等技术,大幅降低了显存需求,并提供了从基础微调到情感导向 RL 训练的完整脚本示例。

    推荐理由:原文给出了在单张24GB消费级GPU上微调20B模型的具体步骤和代码示例,为资源受限环境下的RLHF实践提供了可复用的技术路径。

3月3日周五
3月2日周四
  1. Hugging Face Blog28

    Hugging Face 发布 Diffusers 库伦理指南

    Hugging Face 在 Diffusers 库文档中发布伦理框架,指导维护者处理社区贡献并明确透明度、一致性等核心价值观。该指南配套提供“Not For All Eyes”标签、Stable Diffusion 偏见评估空间及 Safe Stable Diffusion 等安全机制。项目还引入 OpenRAILs 许可与 Hub 分阶段发布功能,以平衡开放访问与负责任使用。

3月1日周三
2月21日周二
2月7日周二
1月30日周一
  1. Hugging Face Blog38

    Hugging Face 计算机视觉生态现状:支持8大核心任务与超3000个模型

    Hugging Face Hub 现已支持图像分类、分割等 8 项核心计算机视觉任务,收录超过 3000 个模型和 100 多个数据集。平台通过 Transformers 库集成 ViT、Swin 及 ConvNeXt 等架构,并提供 Pipelines 简化推理流程。开发者可利用 Trainer API 微调模型,或借助 Datasets 库加载 ImageNet-1k 等数据以加速训练。

1月17日周二
12月9日周五
11月29日周二
  1. Hugging Face Blog10

    Hugging Face 启动 2023 年实习生招聘计划

    Hugging Face 宣布启动 2023 年实习生招聘计划,面向开源、科学及社会影响等团队开放多个职位。具体岗位包括 Accelerate、文本转语音、具身 AI、大语言模型分布式训练框架及数据集构建等方向。申请人需通过官方招聘门户提交申请并创建 Hugging Face 账户,公司鼓励多元背景人才参与以推动负责任的机器学习民主化。

11月21日周一
11月17日周四
  1. Hugging Face Blog42

    Hugging Face Spaces 与 arXivLabs 集成推出 Demo 标签页

    Hugging Face 宣布其 Spaces 平台通过新增 Demo 标签页与 arXivLabs 集成,用户可在论文摘要页直接访问社区或作者创建的开源机器学习演示。自 2021 年 10 月上线以来,Spaces 已承载超 12,000 个基于 Gradio 和 Streamlit 构建的演示,支持无需编写代码即可在浏览器中交互体验模型,显著提升研究的可发现性与复现性。

11月3日周四
  1. Hugging Face Blog60

    Hugging Face 发布使用 Transformers 微调 Whisper 进行多语言语音识别教程

    Hugging Face 博客发布指南,演示如何使用 🤗 Transformers 库对 OpenAI 的 Whisper 模型进行微调,以适配任意多语言自动语音识别(ASR)数据集。

    推荐理由:提供了基于 Hugging Face Transformers 微调 Whisper 进行多语言 ASR 的完整代码流程,展示了仅用少量数据即可显著提升识别性能的方法。