OpenAI 发布 o1 模型
OpenAI 官方宣布推出 OpenAI o1 模型。
OpenAI 官方宣布推出 OpenAI o1 模型。
OpenAI 发布 o1-mini 模型,主打成本高效的推理能力。
量子物理学家 Mario Krenn 使用 OpenAI o1 模型协助解答量子物理领域的重大科学问题。该案例展示了 o1 在复杂推理任务中辅助前沿科学研究的能力,体现了大语言模型在专业学科中的实际应用价值。
经济学家 Tyler Cowen 解析了 OpenAI o1 处理复杂经济问题的方法。该模型通过推理能力应对高难度经济学挑战,展示了其在专业领域的应用潜力。
Hugging Face 团队分享了复现 Google Infini-attention 的实验结果,发现随着内存压缩次数增加,模型在长上下文任务中的性能显著下降且不可靠。
推荐理由:作者详细记录了复现Infini-attention的调试过程与失败原因,揭示了长上下文扩展中压缩记忆的性能瓶颈及收敛难点。
Mistral AI 正式发布新一代大模型 Mistral Large 2,拥有 1230 亿参数并支持 128k 上下文窗口。该模型针对单节点推理优化,在多语言处理、代码生成及逻辑推理方面性能显著提升,并在 MMLU 等基准测试中达到新的高度。
推荐理由:官方公布 Mistral Large 2 的架构参数、多语言支持及在主流基准测试中的性能表现,为评估其成本效益和实际部署能力提供直接依据。
Mistral AI 推出 Mathstral,该模型基于 Mistral 7B 构建,专攻 STEM 领域复杂逻辑推理。Mathstral 在 MATH 基准测试中得分 56.6%,MMLU 得分 63.47%;结合多数投票机制后,MATH 分数提升至 68.37%。
Mistral AI 发布了 Codestral Mamba,这是继 Mixtral 系列后探索新架构的又一成果。该模型由 Albert Gu 和 Tri Dao 协助设计,利用 Mamba 架构实现线性时间推理和无限长度序列建模的理论能力。
推荐理由:Mistral AI 发布了基于 Mamba 架构的 Codestral Mamba,该模型在代码生成和推理能力上可与 SOTA Transformer 模型媲美,且支持线性时间推理。
Numina 与 Hugging Face 联合团队凭借 NuminaMath 7B TIR 模型赢得首届 AI 数学奥林匹克(AIMO)进步奖,在私有测试集上解出 29/50 道题。
Hugging Face 在 Transformers 库中推出了 KV Cache 量化功能,通过降低键值缓存的精度来显著减少长文本生成的内存占用。该功能支持 int2、int4 和 int8 精度,其中 int4 量化在几乎不损失模型质量的情况下可实现约 2.5 倍的显存节省。
Hugging Face 发布 Open Chain of Thought Leaderboard,通过计算准确率增益(Δ = CoT准确率 - 无CoT准确率)评估LLM生成思维链的能力。该榜单基于LogiQA和LSAT等AGIEval任务,采用Classic与Reflect两种提示策略生成推理轨迹,旨在更稳健地衡量模型推理效能并抵抗训练数据污染。
Mistral AI 发布最新开源模型 Mixtral 8x22B,采用稀疏混合专家(SMoE)架构,总参数 141B 但仅激活 39B。该模型支持英法意德西五种语言,具备函数调用能力,拥有 64K tokens 上下文窗口,并以最宽松的 Apache 2.0 许可证发布。在 MMLU、HumanEval 等基准测试中,其性能超越其他开源权重模型,且推理速度优于任何稠密 70B 模型。
推荐理由:官方详细披露了 Mixtral 8x22B 的稀疏激活参数、多语言基准表现及 Apache 2.0 许可,为评估其成本效率与开源价值提供了一手数据。
Hugging Face 推出 NPHardEval 排行榜,利用密歇根大学等研发的基准测试大语言模型推理能力。该基准包含900道算法题,涵盖P、NP-complete及NP-hard复杂度类,并每月动态更新以防止过拟合。实验显示GPT 4 Turbo整体表现最佳,Claude 2在NP-complete问题上领先,Yi-34b等开源模型亦具竞争力。
Hugging Face 博客展示如何利用推测解码(Speculative Decoding)将 Whisper 模型的推理速度提升约 2 倍,同时保证输出结果与原模型完全一致。文章详细给出了使用 Distil-Whisper 或 Whisper tiny 作为辅助模型的技术实现代码、英语及多语言场景下的基准测试结果,并说明了选择辅助模型和控制批次大小等优化策略。
推荐理由:原文提供了在 Hugging Face Transformers 中利用辅助模型实现 Whisper 推理加速的具体代码与基准测试数据,展示了无损提速的工程落地路径。
Hugging Face 发布博客详细解析混合专家模型(MoE),涵盖其稀疏性机制、负载均衡策略及在 Transformer 中的应用。文章对比了 Switch Transformers 等经典工作,探讨了 MoE 在预训练效率、微调稳定性及显存占用方面的权衡,并介绍了专家并行、容量因子优化及量化蒸馏等工程落地技术。
Hugging Face 宣布其 Transformers 库和 Text Generation Inference (TGI) 现已原生支持 AMD Instinct MI250 等 GPU,用户无需修改代码即可在 AMD 硬件上运行大语言模型。
推荐理由:原文展示了 AMD GPU 在无需修改代码的情况下运行 Hugging Face 模型的能力,并提供了与 NVIDIA A100 对比的性能基准数据。
OpenAI 训练了一个在数学问题求解上达到新 SOTA 的模型,该模型通过奖励正确的推理步骤(过程监督)而非仅仅奖励正确答案(结果监督)进行优化。除了提升性能外,过程监督还带来了对齐优势,直接训练模型生成经人类认可的思维链。
Hugging Face 推出 Assisted Generation 解码方法,通过让小模型快速生成候选序列并由大模型并行验证,将文本生成延迟降低最高 10 倍。该方法已集成至 🤗 Transformers 库,用户只需传入 `assistant_model` 参数即可启用,特别适用于语音识别或摘要等输入导向任务。
推荐理由:原文详细拆解了利用小模型辅助大模型生成以突破显存带宽瓶颈的方法,并提供了在 Transformers 库中直接复用的代码实现与性能基准。
Hugging Face Blog 探讨通过红队测试发现 LLM 漏洞,指出 GPT3 等模型易受提示注入攻击并生成有害内容。文章对比了红队与对抗性攻击的区别,强调需结合 RLHF 微调及多组织协作数据集来应对新兴能力带来的安全挑战。
Hugging Face 将 NeurIPS 2022 提出的 Contrastive Search 解码方法集成至 Transformers 库,支持 PyTorch 和 TensorFlow。该方法利用现成语言模型即可生成跨 16 种语言的人类水平文本,有效解决传统确定性方法的重复问题及随机方法的语义连贯性缺陷。
Nyströmformer利用Nyström方法将Transformer自注意力的复杂度从O(n²)降至O(n)。该模型通过查询和键的段均值采样32或64个landmarks来近似softmax矩阵,在长序列(n=4096或8192)上保持与标准自注意力相当的竞争力性能。
OpenAI 开发了一款针对 Lean 的神经定理证明器,成功解决了包括 AMC12、AIME 竞赛题目及两道改编自 IMO 的高难度高中奥赛问题。该模型展示了在形式化数学推理领域的最新进展。
OpenAI 训练出一套解决小学数学应用题的系统,其准确率接近经过微调的 GPT-3 模型的两倍。该系统能解决约 90% 相当于真实儿童水平的问题,在特定测试中得分 55%,而 9-12 岁儿童样本平均得分为 60%。
Hugging Face 发布技术博客,深入解析基于 Transformer 的编码器-解码器架构在序列到序列任务中的数学原理及推理机制。文章重点拆解 Encoder 和 Decoder 组件,并建立理论与 🤗Transformers 库中 T5、Bart、MarianMT 和 Pegasus 等模型实际应用的联系。
Reformer 模型通过重新设计 Transformer 架构,实现用不到 8GB 内存训练长达 50 万 token 的序列。相比 BERT 仅支持 512 token 的限制,Reformer 利用局部自注意力、LSH 哈希、可逆残差层及轴向位置编码四大特性大幅降低显存占用。该模型已集成至 Hugging Face Transformers 库,适用于长文本摘要等任务。
Hugging Face 发布博客文章,详细解析了 Greedy Search、Beam Search、Sampling、Top-K Sampling 和 Top-p (Nucleus) Sampling 等主流文本生成解码策略。文章结合 GPT2 模型演示了如何使用 transformers 库配置这些方法,分析了各策略在解决重复生成和提升连贯性方面的优劣及适用场景。