跳到正文

全部动态

今日 12 条
12月13日周六
12月12日周五
12月11日周四
  1. Hugging Face Blog65

    llama.cpp 发布 Model Management 功能支持多模型动态切换

    llama.cpp server 推出 router 模式,允许在不重启服务的情况下动态加载、卸载和切换多个模型。该功能采用多进程架构,每个模型独立运行,单个模型崩溃不影响其他模型。用户可通过自动发现缓存或指定目录来管理 GGUF 文件,并支持按需加载、LRU 驱逐及请求路由,同时提供 Web UI 进行模型切换。

    推荐理由:llama.cpp 新增 router 模式实现多模型动态加载与切换,无需重启服务即可管理本地 LLM。

  2. OpenAI News70

    OpenAI 发布 GPT-5.2:强化科学与数学能力

    OpenAI 发布 GPT-5.2,称其为迄今在数学和科学领域最强的模型。该模型在 GPQA Diamond 和 FrontierMath 等基准测试中创下新的 SOTA 结果。官方展示其能解决开放理论问题并生成可靠的数学证明,推动实际科研进展。

    推荐理由:原文指出GPT-5.2在GPQA Diamond和FrontierMath等基准上刷新纪录,并展示了其在解决开放理论问题和生成可靠数学证明方面的实际科研进展。

  3. Google DeepMind35

    Google DeepMind 深化与英国 AI 安全研究所合作

    Google DeepMind 宣布与英国 AI 安全研究所(AISI)签署新谅解备忘录,将合作从模型测试扩展至基础安全研究。双方将共享专有模型数据,重点开展思维链监控、社会情感影响评估及经济系统模拟等前沿课题。此举旨在通过联合报告与技术协作,提升 Gemini 3 等先进模型的安全性并推动行业进步。

  4. Hugging Face Blog72

    Hugging Face 发布教程:使用 Codex 和 HF Skills 实现端到端开源模型训练

    Hugging Face 发布教程,指导用户通过 HF Skills 仓库配置 OpenAI Codex,使其能够自动完成大语言模型的微调、评估及发布全流程。该方案支持监督微调(SFT)、直接偏好优化(DPO)等生产级方法,Codex 可自动验证数据集格式、根据模型规模选择 GPU 硬件并提交任务至 Hugging Face Jobs。

    推荐理由:展示了如何通过 HF Skills 让 Codex 自动执行从数据验证、硬件选择到模型发布的全流程,为开发者提供了可复用的自动化训练工作流参考。

  5. OpenAI News74

    OpenAI 发布 GPT-5.2 模型

    OpenAI 正式发布 GPT-5.2 模型,定位为面向专业工作的新一代前沿模型。该版本在推理、编码和长上下文理解方面进行了优化,旨在提升复杂任务的处理效率与可靠性。

    推荐理由:OpenAI 官方宣布推出 GPT-5.2,强调其在专业工作场景下的推理与编码能力升级。

12月10日周三
12月9日周二
12月8日周一
  1. OpenAI News30

    OpenAI 发布企业 AI 现状报告

    OpenAI 基于企业数据发布《The state of enterprise AI》报告,指出2025年各行业AI采用加速、集成加深并带来可衡量的生产力提升。该发现源自OpenAI内部企业数据分析,反映了当前企业级AI应用的整体趋势与成效。

12月5日周五
  1. Google Research43

    Google Research 提出 Titans 架构与 MIRAS 框架以增强 AI 长期记忆

    Google Research 推出 Titans 架构及 MIRAS 理论框架,结合 RNN 速度与 Transformer 精度实现测试时记忆。Titans 利用“惊讶度”指标动态更新参数,通过动量机制和自适应权重衰减管理长序列信息。MIRAS 将序列建模统一为关联内存模块,突破均方误差范式限制,支持实时适应无需离线重训练。

  2. OpenAI News30

    OpenAI 推出 OpenAI for Australia

    OpenAI 正式推出 OpenAI for Australia,旨在构建主权 AI 基础设施并加速澳大利亚 AI 生态系统创新。该计划将重点提升超过 150 万名工人的技能水平,以支持国家层面的技术发展与产业升级。

12月4日周四
  1. Hugging Face Blog78

    Hugging Face 发布 hf-llm-trainer 技能以支持 Claude 等智能体自动微调开源 LLM

    Hugging Face 推出 `hf-llm-trainer` 技能,使 Claude Code、Codex 和 Gemini CLI 等编码智能体能通过自然语言指令自动执行大语言模型的微调任务。

    推荐理由:原文展示了通过自然语言指令让编码智能体完成从硬件选择到模型部署的全流程微调,提供了可复用的技能包配置与成本估算方法。

12月3日周三
  1. Mistral AI87

    Mistral AI 发布 Mistral 3 系列开源模型

    Mistral AI 正式推出下一代模型家族 Mistral 3,包括 Mistral Large 3(41B 激活/675B 总参数的稀疏 MoE)以及 Ministral 3 系列(3B、8B、14B 密集模型)。

    推荐理由:官方发布了包含稀疏 MoE 大模型和密集小模型的 Mistral 3 系列,全部采用 Apache 2.0 协议开源并支持多模态与推理能力。

12月2日周二