OpenAI 发布面向青少年和家长的 AI 素养资源
OpenAI 推出新的 AI 素养资源,旨在帮助青少年和家长安全、自信地使用 ChatGPT。这些指南包含经专家审核的建议,涵盖负责任使用、批判性思维、健康边界设定,以及如何支持青少年处理情感或敏感话题。
OpenAI 推出新的 AI 素养资源,旨在帮助青少年和家长安全、自信地使用 ChatGPT。这些指南包含经专家审核的建议,涵盖负责任使用、批判性思维、健康边界设定,以及如何支持青少年处理情感或敏感话题。
OpenAI 更新其 Model Spec,新增 Under-18 Principles 以规范 ChatGPT 对青少年的支持。该更新基于发展科学提供适龄指导,旨在强化安全护栏并明确高风险场景下的模型行为预期。
OpenAI 与美国能源部签署谅解备忘录,旨在深化在 AI 和先进计算领域的合作以支持科学发现。该协议建立在双方与国家实验室持续合作的基础上,并为在整个美国能源部生态系统中将 AI 应用于高影响力研究建立了框架。
OpenAI 推出其最先进的编程模型 GPT-5.2-Codex。该模型支持长程推理和大规模代码转换,并增强了网络安全相关能力。
推荐理由:官方明确该模型具备长程推理、大规模代码转换及增强的网络安全能力,为开发者评估其在复杂工程任务中的表现提供了核心依据。
Mistral AI 正式发布 Mistral OCR 3,该模型在表单、扫描文档、复杂表格和手写内容上的整体胜率比 Mistral OCR 2 高出 74%。
推荐理由:Mistral OCR 3 在表单、手写和复杂表格识别上较前代有显著提升,且以极低价格提供 API 服务,适合需要高精度文档解析的开发者评估。
NVIDIA 发布 Nemotron 3 Nano 30B A3B,同步公开基于 NeMo Evaluator 的完整可复现评测配方。该方案通过统一配置与结构化日志解决评估不透明问题,支持独立验证模型性能。开发者可利用这一开源工具链构建标准化、可审计的 AI 评测流程。
Google DeepMind 发布 Gemini 3 Flash,旨在以更低成本和更高速度提供接近 Pro 级别的前沿智能。该模型在 GPQA Diamond 得分 90.4%,SWE-bench Verified 得分 78%,比 Gemini 2.5 Pro 快 3 倍且平均少用 30% token。
推荐理由:原文给出了 Gemini 3 Flash 在多项基准测试中的具体分数、定价及与上一代模型的性能对比,读者可据此评估其在速度与成本平衡上的实际竞争力。
OpenAI 联合 American Journalism Project 和 The Lenfest Institute 推出 OpenAI Academy for News Organizations,旨在帮助新闻机构有效使用 AI。该学习中心提供培训、实际用例及负责任使用指南,支持记者、编辑和出版商在报道与运营中采用 AI。
OpenAI 发布《The state of enterprise AI》报告,基于数据展示企业如何从实验阶段转向实际生产力提升。该报告揭示了组织在采用 AI 过程中获得的新能力与效率变化。
OpenAI 正式推出新的平台功能,允许开发者在 OpenAI 生态中构建和部署应用。该更新扩展了现有 API 的能力边界,为第三方集成提供了更丰富的工具支持。
推荐理由:官方宣布新功能上线,开发者可据此评估在 OpenAI 生态中构建应用的新机会。
Google DeepMind 发布 Gemma Scope 2,这是目前规模最大的开源可解释性工具套件,支持从 270M 到 27B 参数的所有 Gemma 3 模型。该工具结合稀疏自编码器(SAEs)和转码器,旨在帮助研究人员追踪模型内部决策过程以调试越狱、幻觉等安全问题。
OpenAI 推出 FrontierScience 基准测试,旨在评估 AI 在物理、化学和生物领域的推理能力。该基准用于衡量 AI 向真实科学研究任务迈进的进展。
OpenAI 推出一个真实世界评估框架,用于衡量 AI 在湿实验室中加速生物研究的能力。该工作利用 GPT-5 优化分子克隆协议,探索了 AI 辅助实验的潜力与风险。
OpenAI 于 2025 年推出更快的 ChatGPT Images 体验,并在 API 中上线 GPT‑Image‑1.5。用户现可探索最新的 ChatGPT Images 2.5 版本。
OpenAI 指出领导者需通过清晰战略、培训、治理及加速创新来构建适应 AI 的组织。该观点旨在帮助企业在人工智能时代保持竞争优势,强调了从策略到执行层面的系统性准备。
Google Research 推出名为 Paper Assistant Tool (PAT) 的实验性工具,利用 Gemini 2.5 Deep Think 为 STOC 2026 的理论计算机科学论文提供提交前的自动反馈。
推荐理由:原文披露了基于 Gemini 2.5 Deep Think 的 Paper Assistant Tool 在 STOC 2026 的实验数据,展示了 AI 辅助理论计算机科学论文预审核的实际效果与用户反馈。
IBM Research 宣布其开源通用智能体框架 CUGA (Configurable Generalist Agent) 正式集成至 Hugging Face Spaces,并提供在线演示。
推荐理由:IBM Research 将 CUGA 智能体集成至 Hugging Face Spaces,提供基于 gpt-oss-120b 的可视化演示及 Langflow 低代码支持,便于开发者快速评估其在复杂任务中的表现。
Google DeepMind 发布升级版 Gemini 2.5 Flash Native Audio 模型,旨在优化实时语音代理的自然对话与复杂任务处理能力。
推荐理由:官方更新了 Gemini 2.5 Flash Native Audio 模型,显著提升了实时语音代理在复杂工作流处理、指令遵循及多轮对话中的表现。
Google 联合 SisonkeBiotik 等社区举办非洲健康数据科学 Ideathon,鼓励利用 MedGemma、TxGemma 和 MedSigLIP 解决本地医疗挑战。冠军 Dawa Health 基于 MedSigLIP 与 Gemini RAG 构建宫颈癌筛查工具,计划明年扩展至 50,000 名患者。
OpenAI 利用 Codex 在 28 天内完成了 Sora for Android 的开发与发布。通过 AI 辅助的规划、代码翻译及并行编码工作流,敏捷团队实现了快速且可靠的交付。
BNY 利用 OpenAI 技术通过 Eliza 平台在全企业范围内扩展 AI 应用,已有超过 20,000 名员工使用该工具构建 AI 智能体。这些由员工创建的 AI 智能体旨在提升运营效率并改善客户服务成果,实现了“人人可用的 AI”这一目标。
BBVA 扩大与 OpenAI 的合作,启动多年期 AI 转型计划并向 120,000 名员工全面部署 ChatGPT Enterprise。双方将共同开发 AI 解决方案,以增强客户互动、简化运营流程并构建原生 AI 银行体验。
llama.cpp server 推出 router 模式,允许在不重启服务的情况下动态加载、卸载和切换多个模型。该功能采用多进程架构,每个模型独立运行,单个模型崩溃不影响其他模型。用户可通过自动发现缓存或指定目录来管理 GGUF 文件,并支持按需加载、LRU 驱逐及请求路由,同时提供 Web UI 进行模型切换。
推荐理由:llama.cpp 新增 router 模式实现多模型动态加载与切换,无需重启服务即可管理本地 LLM。
OpenAI 发布 GPT-5.2,称其为迄今在数学和科学领域最强的模型。该模型在 GPQA Diamond 和 FrontierMath 等基准测试中创下新的 SOTA 结果。官方展示其能解决开放理论问题并生成可靠的数学证明,推动实际科研进展。
推荐理由:原文指出GPT-5.2在GPQA Diamond和FrontierMath等基准上刷新纪录,并展示了其在解决开放理论问题和生成可靠数学证明方面的实际科研进展。
Google DeepMind 宣布与英国 AI 安全研究所(AISI)签署新谅解备忘录,将合作从模型测试扩展至基础安全研究。双方将共享专有模型数据,重点开展思维链监控、社会情感影响评估及经济系统模拟等前沿课题。此举旨在通过联合报告与技术协作,提升 Gemini 3 等先进模型的安全性并推动行业进步。
Podium 基于 OpenAI 的 GPT-5 模型构建了名为“Jerry”的 AI 智能体,旨在为超过 10,000 家中小企业提供自动化客户服务支持。该方案通过引入 AI 队友显著提升了业务运营效率,并实现了 300% 的增长,彻底改变了传统街边小店(Main Street businesses)的服务模式。
OpenAI 发布文章回顾成立十年来的技术进展,从早期研究突破到广泛应用的 AI 系统。文中分享了过去十年的经验教训,并重申了对构建造福全人类的通用人工智能(AGI)的乐观态度。
OpenAI 发布 GPT-5.2 系统卡更新,确认其作为 GPT-5 系列最新模型族的安全缓解策略与 GPT-5 及 GPT-5.1 基本一致。该模型基于公开互联网、第三方合作及用户提供的多样化数据集进行训练。
Hugging Face 发布教程,指导用户通过 HF Skills 仓库配置 OpenAI Codex,使其能够自动完成大语言模型的微调、评估及发布全流程。该方案支持监督微调(SFT)、直接偏好优化(DPO)等生产级方法,Codex 可自动验证数据集格式、根据模型规模选择 GPU 硬件并提交任务至 Hugging Face Jobs。
推荐理由:展示了如何通过 HF Skills 让 Codex 自动执行从数据验证、硬件选择到模型发布的全流程,为开发者提供了可复用的自动化训练工作流参考。
OpenAI 正式发布 GPT-5.2 模型,定位为面向专业工作的新一代前沿模型。该版本在推理、编码和长上下文理解方面进行了优化,旨在提升复杂任务的处理效率与可靠性。
推荐理由:OpenAI 官方宣布推出 GPT-5.2,强调其在专业工作场景下的推理与编码能力升级。
OpenAI 宣布与迪士尼达成多年期战略合作。协议包含迪士尼向 OpenAI 授权其影视角色用于 AI 生成视频,以及将 Sora 和 ChatGPT 深度集成至迪士尼数字生态中。
Google Research 在 COLM 2025 发布 Urania 框架,利用差分隐私(DP)聚类与关键词提取从 LLM 对话中生成安全洞察。该方案通过数学化隐私预算 ε 确保单条对话不影响结果,相比 CLIO 等启发式方法提供更强的形式化隐私保证。
Google DeepMind 宣布深化与英国政府的合作,重点加速 AI 在科学发现、教育现代化及国家安全领域的落地。双方将提供 AlphaEvolve、AlphaGenome 等前沿模型优先访问权,并于 2026 年在英国建立首个全自动材料科学实验室。
OpenAI 正投资加强安全防护与防御能力,以应对 AI 模型在网络安全领域日益增强的功能。该公司通过评估风险、限制滥用以及与社区合作来强化网络韧性。
Scout24 基于 GPT-5 打造对话式助手,重构房地产搜索体验。该工具通过澄清问题、生成摘要及提供定制化房源推荐引导用户。
Mistral AI 推出新一代开源代码模型家族 Devstral 2(123B)和 Devstral Small 2(24B),并发布了原生命令行工具 Mistral Vibe CLI。
推荐理由:原文给出了两款开源代码模型的参数规模、SWE-bench 得分及配套的终端 CLI 工具,读者可据此评估其在本地部署和自动化编程中的实际效能。
Google DeepMind 与 Kaggle 合作发布 FACTS Benchmark Suite,包含参数化、搜索、多模态及 Grounding v2 四个基准,共提供 3,513 个公开示例。
OpenAI 通过官方新闻渠道发布了最新内容。具体细节需参考原文链接以获取完整信息。
OpenAI 发布首批认证课程及 AI Foundations 课程,旨在帮助用户构建实际 AI 技能并提升职业机会。这些课程聚焦于为未来工作做准备,提供从基础到实战的技能培养路径。
OpenAI 与 Deutsche Telekom 达成合作,旨在为欧洲数百万用户提供先进的多语言 AI 体验。双方还将部署 ChatGPT Enterprise,帮助 Deutsche Telekom 员工优化工作流程并加速创新。