跳到正文

全部动态

今日 42 条
3月22日周五
  1. Hugging Face Blog60

    Hugging Face 介绍嵌入向量量化技术以提升检索速度与降低成本

    Hugging Face 博客介绍了嵌入向量的二进制和标量(int8)量化方法,旨在解决大规模检索中的内存与成本瓶颈。通过结合二进制快速检索与 int8 重排序,该方法在保持约 96% 原始性能的同时,将内存占用减少 32 倍,检索速度提升最高达 45 倍。文中提供了基于 Sentence Transformers 库的实现代码及针对 4100 万条维基百科文本的演示案例。

    推荐理由:原文提供了二进制与标量量化结合重排序的检索方案及代码示例,读者可据此评估其在降低内存成本与提升速度间的平衡效果。

3月21日周四
3月20日周三
  1. Hugging Face Blog75

    Hugging Face 发布 Cosmopedia:用于预训练大语言模型的大规模合成数据生成指南

    Hugging Face 推出 Cosmopedia,这是一个包含超过 3000 万个文件和 250 亿 token 的开源合成数据集,旨在复现 Phi-1.5 的训练数据以用于从零开始预训练大语言模型。

    推荐理由:原文详细拆解了从提示词工程到大规模生成的完整技术栈,为复现 Phi 系列合成数据提供了可落地的开源方案。

3月18日周一
3月15日周五
3月13日周三
3月8日周五
  1. OpenAI News60

    OpenAI 完成董事会治理审查 Sam Altman 与 Greg Brockman 继续领导公司

    OpenAI 宣布董事会治理审查工作已完成,Sam Altman 和 Greg Brockman 将继续担任公司领导职务。这一结果标志着此前围绕公司治理结构的争议告一段落,明确了现有管理层的持续领导地位。

    推荐理由:官方确认治理审查结束及核心管理层留任,为关注 OpenAI 内部稳定性的读者提供了明确的最终结论。

3月6日周三
3月5日周二
  1. Hugging Face Blog29

    ConTextual 数据集发布:评估多模态模型在文本丰富场景中的联合推理能力

    UCLA 研究人员推出 ConTextual 数据集,包含 506 个指令,旨在评估大语言模型(LMM)对图像中文本与视觉上下文的联合推理能力。基准测试显示,GPT-4V 等专有模型在信息图和时间读取任务上表现不佳,开源模型如 LLaVA-v1.5-13B 存在显著领域差距。增强型 LLM 方法仅获 17.2% 的人类认可率,表明当前模型在处理文本丰富的真实场景时仍有巨大提升空间。

3月4日周一
2月29日周四
2月28日周三
  1. Hugging Face Blog82

    BigCode 发布 StarCoder2 系列开源代码大模型及 The Stack v2 数据集

    BigCode 团队发布新一代开源代码大模型 StarCoder2 及其训练数据集 The Stack v2,并开放所有模型权重、数据处理和训练代码。StarCoder2 包含 3B、7B 和 15B 三种参数规模,其中旗舰版 StarCoder2-15B 基于 600 多种编程语言和超过 4 万亿 token 训练,性能在同类尺寸中领先并可媲美 33B+ 模型。

    推荐理由:原文公开了 StarCoder2 系列模型的参数规模、训练数据细节及代码权重,为开发者提供了透明可复现的开源代码大模型选择。

2月27日周二
  1. Hugging Face Blog40

    Hugging Face 推出 TTS Arena:基于社区投票的文本转语音模型基准测试

    Hugging Face 发布 TTS Arena,借鉴 Chatbot Arena 模式让用户盲听并投票比较文本转语音模型。该工具收录 ElevenLabs、MetaVoice、OpenVoice 等 SOTA 模型,通过 Elo 算法生成公开排行榜。此举旨在解决 WER 和 MOS 等传统指标在评估语音自然度时的局限性,实现开源与闭源模型的公平对比。

2月26日周一
  1. Mistral AI35

    Mistral AI 发布对话助手 Le Chat

    Mistral AI 推出基于其模型的对话助手 Le Chat,支持 Mistral Large、Mistral Small 及原型模型 Mistral Next。该产品提供企业版 le Chat Enterprise,具备自部署能力和细粒度内容审核机制。目前 Le Chat 无法访问互联网,用户可申请成为 beta 测试者以提供反馈。

2月23日周五
2月21日周三
  1. Hugging Face Blog86

    Hugging Face 宣布支持 Google 开源大模型 Gemma

    Hugging Face 宣布全面支持 Google 发布的开源大模型 Gemma,提供 Transformers 集成及云端部署方案。Gemma 包含 2B 和 7B 参数版本,支持消费级 GPU 运行,并给出了基于 TRL 的单卡微调示例。

    推荐理由:原文详细说明了 Gemma 在 Hugging Face 生态中的集成方式、硬件适配性及微调流程,为开发者提供了从部署到训练的具体技术路径。

2月20日周二
  1. Hugging Face Blog33

    Upstage 推出 Open Ko-LLM Leaderboard:构建韩语大模型评估生态

    Upstage 于2023年9月发起 Open Ko-LLM Leaderboard,旨在建立透明、公平的韩语大模型评估生态。该平台采用 Ko-MMLU 等五项私有测试集以防止数据污染,上线五个月即收录超1,000个模型。KT 的 Mi:dm 7B 在7B参数以下模型中排名第一并开放使用,SOLAR 及基于 LLaMA2、Yi、Mistral 微调的模型表现强劲。

2月19日周一
2月16日周五
  1. Hugging Face Blog67

    Hugging Face 演示用开源 LLM 生成合成数据训练高效专用模型

    Hugging Face 发布教程展示如何利用开源 Mixtral-8x7B-Instruct-v0.1 模型生成合成数据,以微调 RoBERTa-base 等小型专用模型。

    推荐理由:通过金融情感分析案例演示了利用开源大模型生成合成数据并微调小模型的完整流程,提供了具体的成本与性能对比数据及可复用的代码仓库。

2月15日周四
  1. OpenAI News92

    OpenAI 发布 Sora 文本到视频生成模型

    OpenAI 正式推出名为 Sora 的文本到视频生成模型,能够根据提示词生成长达一分钟的高保真视频。该模型展示了在理解物理世界运动规律方面的显著进展,支持复杂场景和多角色互动。

    推荐理由:官方直接发布了新模型的入口和核心能力说明,读者可据此评估其在视频生成领域的实际表现。

2月14日周三
2月13日周二
  1. OpenAI News75

    OpenAI 测试 ChatGPT 记忆功能及新控制选项

    OpenAI 正在测试 ChatGPT 的记忆功能,使其能记住用户讨论的内容以提升后续对话的帮助性。同时提供新的控制选项,让用户掌握对 ChatGPT 记忆的管理权。

    推荐理由:官方宣布测试记忆功能并强调用户控制权,读者可据此了解 ChatGPT 交互逻辑的变化及隐私管理方式。