OpenAI Operator 系统卡发布
OpenAI 发布 Operator 系统卡,详述其多层安全防护体系。文档涵盖针对提示工程与越狱攻击的模型及产品缓解措施、隐私安全保护机制,以及外部红队测试与安全评估细节。
OpenAI 发布 Operator 系统卡,详述其多层安全防护体系。文档涵盖针对提示工程与越狱攻击的模型及产品缓解措施、隐私安全保护机制,以及外部红队测试与安全评估细节。
NVIDIA 发布 Python 工具包 KVPress,通过集成 KnormPress、SnapKVPress 等先进算法压缩 KV Cache,解决长上下文内存瓶颈。该方案支持在 transformers 库中结合量化技术,显著降低如 Llama 3-70B 处理 1M tokens 时高达 327.6GB 的显存需求,助力高效部署大语言模型。
Hugging Face 推出 SmolVLM-256M 和 SmolVLM-500M,其中 256M 版本号称是全球最小的视觉语言模型(VLM)。新模型采用更小的 SigLIP base patch-16/512 视觉编码器以支持更大图像分辨率,并优化了 tokenization 策略,在 transformers、MLX 和 ONNX 中可直接加载运行。
推荐理由:官方发布了256M和500M参数的SmolVLM,展示了在极小参数量下保持多模态性能的技术权衡与优化路径。
Bertelsmann 将在其全球多个品牌中集成 OpenAI 的技术。这家总部位于德国的媒体、服务和教育公司旨在通过该合作提升创造力与生产力。
OpenAI 探讨利用推理时计算提升模型对抗鲁棒性的方法。该研究聚焦于在推理阶段增加算力投入以增强模型抵御对抗攻击的能力,旨在平衡性能与安全需求。
Hugging Face 与 FriendliAI 达成合作,将 Friendli Endpoints 作为部署选项集成至 Hugging Face Hub。开发者可通过“Deploy this model”按钮一键部署模型至 NVIDIA H100 GPU,利用连续批处理、原生量化及自动扩缩容技术实现高性能低成本推理。
OpenAI 及其战略伙伴宣布共同推进 Stargate AGI 基础设施建设。双方计划连接数据中心领域的各类企业,涵盖电力、土地、建筑施工及设备等环节。
OpenAI 正式宣布启动 Stargate 项目。该消息源自 OpenAI News,目前公开信息仅包含项目名称与发布动作,未披露具体技术细节、参数规模或上线时间。
Mistral AI 宣布与法新社(AFP)建立全球合作伙伴关系,其 AI 助手 Le Chat 将接入 AFP 的新闻通讯内容。该集成旨在利用 AFP 每日以六种语言发布的 2,300 条新闻线,提升 Le Chat 回答的事实准确性与时效性。这一功能将在未来几周内逐步向所有 Le Chat 用户推出。
Hugging Face 推出 TimmWrapper,允许用户在 🤗 transformers 生态系统中直接加载和使用任何 timm 计算机视觉模型。
推荐理由:原文提供了将timm模型接入transformers生态的具体代码示例,涵盖量化、微调和torch.compile加速等实用场景。
Hugging Face 推出 TGI Backends 架构,允许通过统一前端集成 vLLM、TensorRT-LLM 等推理引擎。该方案利用 Rust 重构 HTTP 与调度层以规避 Python GIL 限制,提升并发性能。计划于 2025 年第一季度集成 vLLM,并持续扩展对 NVIDIA、AWS 及 Google TPU 等硬件的支持。
OpenAI 宣布与 Axios 建立合作伙伴关系,旨在进一步拓展其在新闻行业的协作范围。目前,代表数百家新闻编辑室和内容品牌的出版商正利用 OpenAI 的合作项目及资助计划采用 AI 工具,以强化新闻生态系统。同时,ChatGPT 用户也能借此获取来自领先且可靠出版物的信息。
Hugging Face 发布两款新的静态嵌入模型 sentence-transformers/static-retrieval-mrl-en-v1(英语检索)和 sentence-transformers/static-similarity-mrl-multilingual-v1(多语言相似度)。
推荐理由:官方发布了在CPU上比主流模型快100至400倍的静态嵌入模型,并公开了完整的训练策略与脚本,为端侧部署提供了高效方案。
Adebayo Ogunlesi 正式加入 OpenAI 董事会。
Mistral AI 发布 Codestral 25.01,采用更高效架构和改进的 tokenizer,代码生成与补全速度约为原版的 2 倍。该模型在 FIM(fill-in-the-middle)用例中达到 SOTA,上下文长度扩展至 256k,并在 HumanEval 等基准测试中领先于同量级模型。
推荐理由:原文给出了新模型的架构改进、速度提升及多语言基准数据,读者可据此评估其在代码补全场景下的实际性能优势。
Hugging Face 指出当前多数 AI Agents 基于 LLM 构建,具备分解任务并自主执行的能力。分析显示系统自主性越高,隐私与安全等风险越大,因此建议不开发能自行编写执行代码的全自主 Agent,而应聚焦于人类保留控制权的半自主模式。
Hugging Face 联合 LlamaIndex 发布 vdr-2b-multi-v1,这是专为多语言视觉文档检索设计的嵌入模型,支持将文档页面截图编码为密集向量而无需 OCR。
推荐理由:原文给出了无需 OCR 的多语言视觉文档检索方案,读者可以据此评估其在跨语言场景下的效率与精度。
Hugging Face 在 Open LLM Leaderboard 中集成碳足迹估算,分析自 2024 年 6 月以来评估的 3,000 多个开源大语言模型的推理能耗。数据显示社区微调模型通常比官方模型更具碳效率,Qwen-2.5-14B 和 Phi-3-Medium 展现出最佳的分数与排放比。
Hugging Face 推出 smolagents,这是一个旨在简化语言模型智能体能力的轻量级库。其核心特性是 CodeAgent,允许智能体以 Python 代码形式编写动作,相比传统的 JSON 工具调用具有更好的组合性和通用性,并支持通过 E2B 进行沙箱安全执行。
推荐理由:该库通过让智能体直接编写代码而非JSON来执行动作,并提供了沙箱执行与Hub集成,为构建灵活且安全的AI工作流提供了新的工程范式。
OpenAI 指出其组织结构必须演进,以实现由营利性实体成功支持的更强非营利组织这一愿景。该调整旨在确保公司架构更好地服务于推进人工智能造福人类的根本使命。
Hugging Face 发布教程指导如何使用 PyTorch 内置工具可视化训练过程中的 GPU 显存占用。文章详细解析了模型参数、优化器状态、激活值等组件的显存构成,并提供了一套估算总显存需求的数学公式及启发式方法。
推荐理由:文章拆解了PyTorch显存快照工具的使用,并给出了基于模型参数和激活值的显存估算公式,有助于开发者定位训练中的内存瓶颈。
NVIDIA 推出 LogitsProcessorZoo,这是一套专为控制序列长度、强制关键短语及引导多选题答案设计的模块化 logits 处理器。该库完全兼容 Hugging Face Transformers 的 generate 方法,允许用户通过直接修改概率分布来精细调控大语言模型的文本生成行为。
OpenAI 于 2024-12-20 发布了一项新的模型更新。
Artificial Analysis 发布 Big Bench Audio 数据集,用于评估音频语言模型的推理能力。该数据集改编自 Big Bench Hard,包含 1000 个音频问题,涵盖逻辑演绎、导航和计数等类别。
推荐理由:原文通过对比不同音频处理模式,量化了原生语音模型在复杂推理任务上的性能落差,为评估语音智能体能力提供了具体基准数据。
Answer.AI 和 LightOn 发布 ModernBERT,这是一系列基于 Transformer++ 架构的 state-of-the-art 编码器模型,旨在全面替代 BERT。
推荐理由:ModernBERT 将 LLM 架构改进引入编码器,提供 8k 上下文和代码理解能力,为检索和分类任务带来显著效率提升。
IBM、普林斯顿大学、卡内基梅隆大学和伊利诺伊大学香槟分校联合推出 Bamba-9B,这是一款完全使用开放数据训练的混合 Mamba2 模型。在 vLLM 框架下,该模型相比标准 Transformer 实现了 2.5 倍吞吐量提升和 2 倍延迟加速。目前模型已支持 transformers、vLLM、TRL 和 llama.cpp,并公开了包含有状态数据加载器在内的训练与微调配方。
推荐理由:IBM 联合高校发布基于开放数据训练的混合 Mamba2 模型,提供显著推理效率提升及完整训练复现资源。
OpenAI 官方新闻源发布了一条关于新模型的公告,具体型号及详细能力参数未在标题或摘要中明确列出。
Technology Innovation Institute (TII) 发布了 Falcon3 系列开源大语言模型,包含 1B、3B、7B、10B 以及 Mamba-7B 五个基础模型版本。
推荐理由:原文详细列出了Falcon3系列各尺寸模型的基准测试得分及训练创新点,读者可据此评估其在小参数规模下的性能表现与开源许可适用性。
Hugging Face 在 Google Cloud C4(第 5 代 Xeon)与 N2(第 3 代 Xeon)实例上对比文本嵌入和生成性能。C4 的文本嵌入吞吐量比 N2 高 10x 至 24x,文本生成高 2.3x 至 3.6x。考虑价格因素后,C4 在两项任务中分别保持 7x~19x 和 1.7x~2.9x 的 TCO 优势,证明轻量级 Agentic AI 可完全部署于 CPU。
Hugging Face 发布 Synthetic Data Generator,这是一款基于 LLM 的无代码应用,允许用户通过自然语言描述在几分钟内创建自定义数据集。
针对马斯克最新诉讼,OpenAI 指出其早在 2017 年便主动提议并创建将 OpenAI 转为营利实体的新架构。这一事实直接反驳了马斯克近期试图重塑指控的第四次法律行动。
Hugging Face 联合 Entalpic 发布开源协作项目 LeMaterial,旨在加速材料科学研究。其首个数据集 LeMat-Bulk 整合了 Materials Project、Alexandria 和 OQMD,包含 6.7M 条目及 7 种材料属性,采用 CC-BY-4.0 许可并统一数据格式以解决碎片化问题。
OpenAI 正式推出 Sora,这是一款能够根据文本提示词生成长达一分钟视频的 AI 模型。该模型能准确理解用户的指令并呈现复杂的场景、角色和多镜头叙事。Sora 目前向部分测试用户开放,旨在展示其在模拟物理世界方面的能力。
推荐理由:官方直接宣布新模型上线,提供了最权威的能力定义和访问入口信息。
Hugging Face 社区推出 Apache 2.0 许可的 open-image-preferences-v1 数据集,旨在解决文本到图像生成领域缺乏开源偏好数据的问题。该数据集基于 Flux 和 Stable Diffusion 3.5-large 生成的图像,涵盖多种风格类别与提示复杂度,并提供了配套的 LoRA 微调模型及预处理代码。
OpenAI 发布视频生成模型 Sora 的系统卡。Sora 支持文本、图像及视频输入,能生成全新视频,其设计基于 DALL-E 和 GPT 模型的经验,旨在为用户提供扩展的故事讲述与创意表达工具。
OpenAI 提出将 AI 技术应用于产品团队的工作流程中。该观点旨在探索如何利用人工智能提升产品团队的效率与产出能力。
电影制作组合 Vallée Duhamel 解释了 Sora 如何帮助构建新世界。
Hugging Face 宣布其 83 个开源模型现已在 Amazon Bedrock Marketplace 上架,底层由 SageMaker JumpStart 管理。
动画师 Lyndon Barrois 分享了如何使用 Sora 作为叙事工具来创造新世界。
跨学科艺术家 Minne Atairu 探讨了 OpenAI 视频生成模型 Sora 如何帮助其实现艺术愿景。该文章聚焦于创作者利用 AI 工具拓展视觉表达边界的具体实践与思考,展示了 Sora 在辅助创意落地过程中的应用价值。