跳到正文

全部动态

今日 12 条
12月5日周四
  1. OpenAI News60

    OpenAI 发布 o1 System Card 安全评估报告

    OpenAI 发布 o1 System Card,概述了 o1 和 o1-mini 模型发布前开展的安全工作。该报告详细说明了依据 Preparedness Framework 进行的外部红队测试及前沿风险评估情况。

    推荐理由:原文提供了 OpenAI o1 系列模型发布前的安全评估报告,读者可据此了解其遵循 Preparedness Framework 进行的红队测试与风险评测细节。

  2. Hugging Face Blog78

    Hugging Face 介绍 Google 发布的 PaliGemma 2 视觉语言模型

    Hugging Face 博客介绍了 Google 新发布的 PaliGemma 2 视觉语言模型,该模型结合了 SigLIP 图像编码器与 Gemma 2 语言模型,提供 3B、10B 和 28B 三种参数规模,并支持 224x224、448x448 和 896x896 多种输入分辨率。

    推荐理由:原文给出了PaliGemma 2的多尺寸变体、分辨率支持及量化性能数据,读者可据此评估其在不同算力条件下的微调潜力与部署成本。

12月4日周三
  1. Hugging Face Blog33

    Hugging Face 推出 AraGen:基于 3C3H 指标的阿拉伯语 LLM 评测基准与排行榜

    Hugging Face 发布 AraGen,这是首个针对阿拉伯语大语言模型的生成式任务基准与排行榜。该框架引入 3C3H 评估指标,利用 LLM-as-judge 从正确性、完整性等六个维度综合衡量模型的事实准确性与可用性。AraGen 采用为期三个月的盲测动态评估策略,旨在解决数据污染问题并为低资源语言提供公平评测标准。

12月3日周二
12月2日周一
11月26日周二
  1. Hugging Face Blog68

    Hugging Face 发布 SmolVLM 2B 视觉语言模型

    Hugging Face 发布 SmolVLM,这是一款参数量为 2B 的视觉语言模型,在 transformers 库中实现了最低的显存占用(约 5.02 GB)。

    推荐理由:SmolVLM 在保持视觉问答能力的同时将显存占用降至约 5GB,为端侧部署和低成本微调提供了具体的性能基准与开源训练配方。

  2. Hugging Face Blog42

    Hugging Face 重构上传下载架构引入内容寻址存储

    Hugging Face Xet 团队重新设计 Hub 上传下载架构,引入内容寻址存储(CAS)以突破现有限制。新协议采用“智能写入、简单读取”理念,在字节级分析文件以优化去重与压缩,预计可将 Safetensors 等张量文件的上传速度提升 10-25%。该方案旨在解决大模型权重传输瓶颈,并为全球用户提供更低延迟和更安全的审计追踪。

11月25日周一
  1. Hugging Face Blog55

    Hugging Face 博客详解如何从零设计 SOTA 位置编码 RoPE

    Hugging Face 发布技术博客,详细演示了如何从简单的整数编码逐步迭代推导出当前最先进的旋转位置编码(RoPE)。文章分析了正弦位置编码的局限性,解释了为何在自注意力机制中采用乘法而非加法来保留语义信息,并展示了 RoPE 如何通过旋转矩阵实现相对位置的高效编码及向多维数据的扩展。

11月21日周四
11月20日周三
  1. Hugging Face Blog38

    BAAI 推出首个多语言 LLM 辩论竞技场 FlagEval-Debate

    BAAI 发布首个多语言 LLM 辩论竞技场 FlagEval-Debate,支持中、英、阿、韩四种语言。该平台引入真实的多模型对抗机制,结合专家评审与用户投票双重指标,旨在解决传统静态评估缺乏区分度及孤立生成导致的偏见问题。开发者可自定义参数策略以优化模型在辩论场景下的推理表现。

  2. Hugging Face Blog42

    Hugging Face Xet 团队利用内容定义分块技术提升存储效率

    Hugging Face Xet 团队采用内容定义分块(CDC)技术,仅传输修改后的数据块以优化 Git LFS 存储。在 CORD-19 数据集基准测试中,该方案使平均下载时间从 51 分钟降至 19 分钟,存储占用从 8.9 GB 减至 3.52 GB。预计对 PyTorch 检查点实现 50% 去重率,可节省高达 100 TB 存储空间,计划于 2025 年初推出基于 Xet 的仓库。

11月19日周二
11月18日周一
  1. Mistral AI65

    Mistral AI 发布 le Chat 重大更新,集成 Canvas、联网搜索与图像生成

    Mistral AI 宣布为其免费生成式 AI 助手 le Chat 推出多项 Beta 新功能,包括带引用的联网搜索、用于创意构思和行内编辑的 Canvas 界面、基于 Pixtral Large 的文档与图像理解能力,以及由 Black Forest Labs Flux Pro 驱动的图像生成功能。

    推荐理由:Mistral 为 le Chat 集中上线了联网搜索、Canvas 画布及多模态理解等 Beta 功能,展示了其从模型层向应用层整合的完整工作流方案。

  2. Mistral AI80

    Mistral AI 发布 Pixtral Large 124B 多模态模型

    Mistral AI 发布 Pixtral Large,这是一个基于 Mistral Large 2 构建的 124B 参数开源权重多模态模型。该模型包含 123B 的多模态解码器和 1B 参数的视觉编码器,支持 128K 上下文窗口,能容纳至少 30 张高分辨率图像。

    推荐理由:原文给出了124B参数规模、128K上下文窗口及在MathVista等基准上的具体得分,读者可据此评估其图像理解能力与开源权重可用性。

11月15日周五
11月13日周三
11月12日周二
11月7日周四
  1. Mistral AI42

    Mistral Batch API 发布

    Mistral AI 推出 Batch API,处理高容量请求的成本比同步 API 低 50%。该功能已在 La Plateforme 上线,支持所有模型,适用于文档摘要、向量嵌入及数据标注等场景。每个工作区限制 100 万个进行中请求。

  2. Mistral AI44

    Mistral AI 发布内容审核 API

    Mistral AI 推出基于 LLM 的内容审核 API,该模型将文本分类为 9 个类别,支持原始文本和对话内容端点。此 API 驱动 Le Chat 的审核服务,原生支持阿拉伯语、中文等 11 种语言,旨在通过处理无资质建议和 PII 等风险增强系统级安全防护。

11月5日周二
11月4日周一
  1. Hugging Face Blog45

    Argilla 2.4 发布:无需代码即可在 Hub 构建微调与评估数据集

    Argilla 2.4 推出无代码功能,允许用户直接从 Hugging Face Hub 导入数据集并定义问题以收集人类反馈。该工具作为开源数据中心平台,简化了社区协作标注流程,支持通过 UI 实时配置字段与问题类型。此更新降低了非技术人员参与高质量 AI 数据集构建的门槛,适用于微调或评估场景。

10月31日周四
  1. OpenAI News78

    OpenAI 发布 ChatGPT Search

    OpenAI 正式推出 ChatGPT Search 功能,允许用户在 ChatGPT 中直接进行实时网络搜索。该功能旨在提供比传统搜索引擎更自然、更具上下文关联性的答案体验。

    推荐理由:官方宣布推出 ChatGPT Search,用户可直接在对话中获取实时网络信息,改变了传统搜索交互方式。

10月30日周三
10月29日周二
10月28日周一
10月24日周四
10月23日周三
  1. Hugging Face Blog38

    Hugging Face 发布 CinePile 2.0:通过对抗性精炼增强长视频问答数据集

    Hugging Face 推出 CinePile 2.0,采用新提出的“对抗性数据集精炼”方法显著优化长视频 QA 数据集。该版本旨在解决初版中部分问题无需视觉信息即可回答及存在退化项的局限,提升数据质量与难度。CinePile 1.0 曾包含约 30 万训练样本,其基准测试显示人类表现优于最佳商业视觉模型 25%。

  2. Hugging Face Blog78

    Google DeepMind 与 Hugging Face 联合发布 SynthID Text 文本水印技术

    Google DeepMind 和 Hugging Face 宣布在 Transformers v4.46.0 中推出 SynthID Text,允许通过 logits processor 对 AI 生成文本添加不可见水印并利用分类器检测。

    推荐理由:原文给出了在 Transformers 中集成 SynthID Text 的具体配置参数、代码示例及检测器训练流程,开发者可据此评估其在现有 LLM 生成链路中的落地可行性。