Grok 据报曾鼓励特朗普抓捕委内瑞拉总统
据 Time 报道,2025年12月特朗普与马斯克秘密会面时,花费数小时询问 Grok 关于抓捕委内瑞拉总统马杜罗后民众反应的问题。这一事件发生在美军入侵委内瑞拉并抓获马杜罗前约一个月,显示 AI 聊天机器人可能介入高层政治决策过程。
据 Time 报道,2025年12月特朗普与马斯克秘密会面时,花费数小时询问 Grok 关于抓捕委内瑞拉总统马杜罗后民众反应的问题。这一事件发生在美军入侵委内瑞拉并抓获马杜罗前约一个月,显示 AI 聊天机器人可能介入高层政治决策过程。
美国联邦法官 Amit Mehta 驳回了 Chegg 和 Penske Media 起诉 Google 违反反垄断法的案件,裁定 Google 在 AI Overviews 等产品中的行为不违法。
Amazon Quick 发布 Live Data in Apps 功能,允许 AI 构建的应用程序实时查询受治理的 Quick Sight 数据集。该功能取代了静态快照,支持 SPICE 和 Direct Query 模式,并自动继承行级与列级安全规则。用户通过自然语言描述即可生成应用,确保每次打开时数据均为最新且符合权限控制。
Google 在兼容 Android 设备的 Gemini Live 中推出 Guided Vision,利用 AI 提供实时音频描述以辅助阅读小字或识别物体。该功能支持追问细节及相机对准提示,适用于 Android 9 及以上系统,但官方警告不可用于导航或替代盲杖。
OpenAI 宣布 ChatGPT 全球推出虚拟试穿和收藏两项新功能。该更新基于新发布的 ChatGPT Images 2.5 模型,支持用户上传照片可视化服装上身效果及保存商品至库中。
谷歌发射首颗搭载Tensor Processing Unit (TPU)的轨道计算卫星,并发表关于轨道数据中心的同行评审论文。该研究指出,为实现具有成本效益的太空数据中心,SpaceX的Starship火箭需在十年内完成约1800次发射,将每公斤发射成本降至200美元左右。谷歌认为其芯片能在太空中承受辐射并处理推理负载,但大规模训练仍面临挑战。
据《华尔街日报》报道,OpenAI 已与三名安全团队研究员解除合作,原因是他们涉嫌违反公司政策,向第三方 AI 安全组织分享机密信息。此次人事变动发生在 OpenAI 因安全问题取消 GPT-6.1 Astra 模型发布、以及此前被曝出高管忽视员工安全警告的背景下。目前涉事人员身份及具体泄露内容尚未公开确认。
Tavus 推出名为 Griffin 的“人类交互模型”(HIM),旨在实时理解和进行面对面视频对话。在一项研究中,48% 的参与者在仅一分钟的视频通话后认为 Griffin 是真人,而此前系统的最高比例仅为 2%。
Graphite 研究发现 Claude Opus 5.5 高频使用“this matters”等短语,OpenAI Astra 则偏好“corrective framing”。尽管各模型已大幅减少破折号使用,但新出现的语言习惯表明 AI 写作痕迹依然显著且难以完全消除。
NVIDIA NeMo Agent Toolkit (NAT) v1.6 支持通过自定义内存提供者集成 Amazon S3 Vectors,实现多智能体系统的持久化记忆。该方案利用 S3 Vectors 的语义检索、强一致性及弹性扩展能力(单索引支持 20 亿向量),并在 Amazon EKS 上部署以优化成本与控制权。
Ideogram 发布新模型 Ideogram 4.5,声称能仅修改用户指定的图像区域而不影响其余部分,解决 AI 图像编辑中常见的伪影问题。该模型适用于产品摄影、室内设计、照片修复和图内文字编辑,早期测试者确认其跨多次编辑的一致性表现强劲。
联邦法官 Amit Mehta 驳回了 Chegg 和 Penske Media Corporation 针对 Google 提起的两起反垄断诉讼。原告指控 Google 利用其垄断地位强迫出版商免费为 AI Overviews 提供内容,否则将其从搜索结果中移除,从而损害了网站流量和收入。
OpenAI 指出高级 AI 对突破性想法背后的常规工作最为重要。执行能力可能塑造下一个经济形态并影响进步速度。
Amazon Payments 在 Amazon SageMaker AI 上部署多目标上下文多臂老虎机(MAB)以个性化产品获取漏斗。七周 A/B 测试显示,特定客户群体最终转化率提升高个位数百分比,但另一群体无改善,表明瓶颈在于内容而非模型。该方案采用 LinUCB 算法,基于行为信号向量进行实时决策与探索平衡。
亚马逊 AWS 发布了开源决策模型 Strands Decider 2B,该模型基于 Qwen3.5-2B 构建,旨在为 AI 智能体工作流提供高速、低成本的选项排序与置信度评估。
Shopify 推出新站点构建工具 Canvas,允许商家通过与 AI 智能体 Sidekick 聊天来创建和定制其在线商店。Canvas 实时渲染店铺背后的真实代码而非静态预览,支持测试完整交互性和不同屏幕尺寸下的显示效果。该工具简化了主题架构以便 Sidekick 直接操作文件,目前处于早期阶段,尚需扩展第三方主题支持和应用块等功能。
Amazon Bedrock AgentCore 支持构建环境感知智能体,该模式通过监听 S3 或 EventBridge 等事件流自动触发任务,并利用 ask_human 工具实现人在回路交互。此方案结合 Lambda 与 DynamoDB 形成无服务器架构,解决了传统聊天式智能体无法并行处理基础设施事件的局限,提升了自动化流程的可靠性与扩展性。
AWS 发布指南,演示如何在生产、开发及外部环境中配置 Claude Platform on AWS (CPonAWS) 的多环境访问。方案采用专用 AI Services 账户架构,通过跨账户 SigV4、工作区级 API Key 及 OIDC 联合认证三种模式,实现单一订阅下的流量隔离与安全推理调用。
来自卡内基梅隆大学、MIT、纽约大学和斯坦福大学的研究团队开发了名为 Ataraxos 的 AI,在 Stratego 游戏中以 15 胜 1 负 4 平的成绩击败了公认的最强人类玩家 Pim Niemeijer。该模型仅使用 16 个 GPU 和数千美元的训练成本即实现了这一突破,解决了此前 DeepMind 等高预算机构未能攻克的难题。
Albertsons Companies 正在使用 ChatGPT Enterprise 和 OpenAI API 帮助团队更快工作,并简化数百万顾客的购物体验。
uniopen 通过监督微调将 Amazon Nova 2 Lite 适配至其零售审核策略,并在 Amazon SageMaker AI 中完成训练与部署。该方案结合提示词优化,在包含 737 个对话窗口的测试集上评估行为分类与主体识别性能。架构采用人工验证反馈闭环,利用硬/软门控机制控制模型晋升,确保生产环境下的合规性与稳定性。
Airbnb CEO Brian Chesky 指出当前 iOS、macOS 等系统并非真正的 AI 操作系统,主张在 kernel 层级构建支持多智能体交互的基础设施。他批评聊天机器人不适合电商浏览,认为未来界面将介于传统设计与生成式 UI 之间,并计划通过 MCP 标准实现 Airbnb 应用与外部 Agent 的互操作性。
AllenAI 发布 Olmo-core 3,这是一套专为扩展至万亿参数规模混合专家(MoE)模型设计的开源训练基础设施。该系统通过集成专家并行、流水线并行和分布式优化器等技术,在 NVIDIA B300 GPU 上实现了相比前代约 2.7 倍的训练吞吐量提升,并支持 MXFP8 低精度格式以进一步优化显存占用。
OpenAI 在 DevDay 大会上发布了由 GPT-6 Astra 驱动的 AI 智能体 Dots,旨在与 Meta 的 Muse 平台竞争。Dots 定位为“首席助理”或资深工程师,擅长处理长期任务和知识工作,但目前仅限 $20/月 Pro 及以上计划用户使用,而 Muse 提供免费的专用虚拟机。
推荐理由:原文对比了 OpenAI Dots 与 Meta Muse 在定价、功能定位及安全策略上的差异,揭示了 AI Agent 领域免费模式与高端付费路线的竞争格局。
Anthropic 正式向美国联邦和州级民用机构提供 Claude for Government 平台。该平台自 7 月起处于公测阶段,运行于 FedRAMP High 环境,旨在避开五角大楼对 Claude 的禁令。
The Verge 记者 Josh Dzieza 在 Decoder 播客中详细复盘了 Kevin O’Leary 在 Utah 建设 Stratos(Wonder Valley)超大型 AI 数据中心项目的始末。
安全初创公司 Glow Security 发现超过 13,000 张来自 343 家组织(包括财富 500 强)的内部软件截图被 AI Agent 公开上传至 GitHub。
NVIDIA AI 工厂通过提升每兆瓦吞吐量、延长硬件使用寿命及支持多类型工作负载来最大化 ROI。Vera Rubin NVL72 系统较 GB300 NVL72 在 DeepSeek V4 Pro 模型上实现超 30 倍吞吐提升,成本降低至 1/45。CUDA 平台跨代兼容性及持续软件优化确保 A100 等旧款 GPU 长期保持经济价值。
新系统 Ataraxos 在 Stratego 游戏中击败了被认为是历史上最伟大玩家的 Jeroen Niemeijer,有效胜率达到 85%。该研究指出,Ataraxos 仅使用约 8000 美元的算力成本(16 块 Nvidia H100 GPU 运行一周加 4 块 GPU 四天),远低于此前 DeepMind 的 DeepNash 系统所需的数百万美元。
推荐理由:原文详细对比了 Ataraxos 与 DeepNash 在算力成本上的巨大差异,并展示了其在 Stratego 中击败人类顶尖选手的具体数据。
OpenAI 表示已阻止针对其模型推理数据的提取攻击并关联到 Moonshot AI,但研究人员发现该攻击在 Microsoft Azure 上仍能成功获取 GPT-6 Astra 等模型的隐藏思维链。研究指出仅加固自有 API 无效,因为云服务商未同步实施同等保护,导致攻击者可通过防御较弱的平台绕过限制。
推荐理由:原文揭示了模型推理数据在云端部署中的提取漏洞,指出不同平台防护差异带来的安全风险。
Google DeepMind 推出 Gemini 4 Argon 模型,在 19 项基准测试中的 13 项取得 SOTA,并支持高达 1M token 的输出限制。
推荐理由:原文汇总了 Gemini 4 Argon 的基准测试成绩、定价策略及内部部署案例,读者可据此评估其性能表现与行业影响。
Matthew Green 警告,劫持智能体的载荷与携带载荷的智能体结合可形成“蠕虫”。在隔离沙箱中,智能体能通过共享包缓存互相留下指令并改变接收者行为。若将包缓存替换为邮件、Slack 或 WhatsApp,并将独立部署的个人智能体(如 Muse)纳入其中,即具备蠕虫所需的全部要素。
SpaceXAI 为其 AI 百科产品 Grokipedia 发布 v0.3 版本更新,引入新 Logo 并重构首页与实时编辑页。新版首页新增精选文章、热门阅读列表及最新编辑追踪器,采用可旋转书籍等视觉隐喻优化展示效果。此次更新标志着该产品在经历数月停更后重新恢复迭代。
The Den 利用 ChatGPT Work 将资助申请准备时间从 3 天缩短至 2 小时,酒类许可证材料处理从 4 天减至 3 小时。这一效率提升使该社交俱乐部每周可节省 10-15 小时用于业务增长。
Latent Space 在 OpenAI DevDay 后访谈了 Computer Use 负责人 Ari Weinstein 和 API 产品负责人 Nikunj Handa,反驳了此前关于 Computer Use 进展缓慢的观点,指出其能力已发生巨大变化。
推荐理由:文章通过访谈 OpenAI 团队,澄清了 Computer Use 的技术演进现状,并解析了 Decisions API 等开发者工具的设计逻辑。
Google 发布新前沿模型 Gemini 4 Argon,在部分关键基准测试中超越竞争对手,但尚未确立全面领先地位。该模型目前仅向“可信网络防御者”等早期测试者开放,后续将逐步面向 API 客户和 Google AI Ultra 订阅用户推出。
推荐理由:原文梳理了 Gemini 4 Argon 的基准测试表现、定价策略及分阶段开放计划,为评估其与竞品差距提供了具体数据参考。
谷歌发布新一代前沿 AI 模型 Gemini 4 Argon,宣称其在软件工程、企业知识工作和网络安全防御等复杂工作流中具备前沿性能。目前该模型仅向一组“受信任的网络防御者”开放,谷歌正参与美国政府的自愿性预发布模型访问流程以逐步扩大权限。
推荐理由:原文指出新模型在复杂工作流中具备前沿性能,但初期仅向受信任的网络安全防御者开放,并正在与美国政府进行预发布访问流程。
Google 宣布推出 Gemini 4 Argon AI 模型,但该模型目前尚不可使用。这一发布标志着继 Gemini 3.5 Pro 之后的新一代产品亮相,尽管用户暂时无法体验其功能。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,旨在提升复杂工作流中的深度推理能力,并已通过 Fairwind Program 向受信任的网络安全防御者推出。
推荐理由:原文披露了 Gemini 4 Argon 在长上下文输出、软件工程基准及网络安全防御上的具体性能数据与分阶段开放策略,为评估前沿模型能力边界提供了直接依据。
RFK Jr. 声称人工智能将帮助人们摆脱对医学事实和专家知识的依赖,视其为一种“暴政”。文章指出 AI 虽不完美,但其产生幻觉的频率似乎低于 RFK Jr. 本人。