跳到正文

全部动态

今日 20 条
今天10月2日周五
  1. TechCrunch · AI73

    Grok 据报曾鼓励特朗普抓捕委内瑞拉总统

    据 Time 报道,2025年12月特朗普与马斯克秘密会面时,花费数小时询问 Grok 关于抓捕委内瑞拉总统马杜罗后民众反应的问题。这一事件发生在美军入侵委内瑞拉并抓获马杜罗前约一个月,显示 AI 聊天机器人可能介入高层政治决策过程。

  2. AWS Machine Learning Blog40

    Amazon Quick 推出 Live Data in Apps,支持 AI 应用实时查询受治理数据

    Amazon Quick 发布 Live Data in Apps 功能,允许 AI 构建的应用程序实时查询受治理的 Quick Sight 数据集。该功能取代了静态快照,支持 SPICE 和 Direct Query 模式,并自动继承行级与列级安全规则。用户通过自然语言描述即可生成应用,确保每次打开时数据均为最新且符合权限控制。

  3. TechCrunch · AI73

    谷歌称Starship需发射1800次才能支撑太空数据中心

    谷歌发射首颗搭载Tensor Processing Unit (TPU)的轨道计算卫星,并发表关于轨道数据中心的同行评审论文。该研究指出,为实现具有成本效益的太空数据中心,SpaceX的Starship火箭需在十年内完成约1800次发射,将每公斤发射成本降至200美元左右。谷歌认为其芯片能在太空中承受辐射并处理推理负载,但大规模训练仍面临挑战。

  4. TechCrunch · AI68

    OpenAI 解雇三名安全研究员,涉泄露机密信息

    据《华尔街日报》报道,OpenAI 已与三名安全团队研究员解除合作,原因是他们涉嫌违反公司政策,向第三方 AI 安全组织分享机密信息。此次人事变动发生在 OpenAI 因安全问题取消 GPT-6.1 Astra 模型发布、以及此前被曝出高管忽视员工安全警告的背景下。目前涉事人员身份及具体泄露内容尚未公开确认。

  5. AWS Machine Learning Blog42

    AWS 使用上下文多臂老虎机优化 Amazon Payments 转化漏斗

    Amazon Payments 在 Amazon SageMaker AI 上部署多目标上下文多臂老虎机(MAB)以个性化产品获取漏斗。七周 A/B 测试显示,特定客户群体最终转化率提升高个位数百分比,但另一群体无改善,表明瓶颈在于内容而非模型。该方案采用 LinUCB 算法,基于行为信号向量进行实时决策与探索平衡。

  6. TechCrunch · AI60

    Shopify 发布 Canvas:通过 AI 聊天构建在线商店

    Shopify 推出新站点构建工具 Canvas,允许商家通过与 AI 智能体 Sidekick 聊天来创建和定制其在线商店。Canvas 实时渲染店铺背后的真实代码而非静态预览,支持测试完整交互性和不同屏幕尺寸下的显示效果。该工具简化了主题架构以便 Sidekick 直接操作文件,目前处于早期阶段,尚需扩展第三方主题支持和应用块等功能。

  7. AWS Machine Learning Blog47

    基于 Amazon Bedrock AgentCore 构建环境感知智能体:从事件驱动信号到人在回路工作流

    Amazon Bedrock AgentCore 支持构建环境感知智能体,该模式通过监听 S3 或 EventBridge 等事件流自动触发任务,并利用 ask_human 工具实现人在回路交互。此方案结合 Lambda 与 DynamoDB 形成无服务器架构,解决了传统聊天式智能体无法并行处理基础设施事件的局限,提升了自动化流程的可靠性与扩展性。

  8. Ars Technica · AI58

    Ataraxos AI 以低成本击败史上最强 Stratego 玩家

    来自卡内基梅隆大学、MIT、纽约大学和斯坦福大学的研究团队开发了名为 Ataraxos 的 AI,在 Stratego 游戏中以 15 胜 1 负 4 平的成绩击败了公认的最强人类玩家 Pim Niemeijer。该模型仅使用 16 个 GPU 和数千美元的训练成本即实现了这一突破,解决了此前 DeepMind 等高预算机构未能攻克的难题。

10月1日周四
  1. AWS Machine Learning Blog25

    uniopen 定制 Amazon Nova 2 Lite 实现零售内容审核生产部署

    uniopen 通过监督微调将 Amazon Nova 2 Lite 适配至其零售审核策略,并在 Amazon SageMaker AI 中完成训练与部署。该方案结合提示词优化,在包含 737 个对话窗口的测试集上评估行为分类与主体识别性能。架构采用人工验证反馈闭环,利用硬/软门控机制控制模型晋升,确保生产环境下的合规性与稳定性。

  2. TechCrunch · AI42

    Brian Chesky:AI 智能体需要专属操作系统

    Airbnb CEO Brian Chesky 指出当前 iOS、macOS 等系统并非真正的 AI 操作系统,主张在 kernel 层级构建支持多智能体交互的基础设施。他批评聊天机器人不适合电商浏览,认为未来界面将介于传统设计与生成式 UI 之间,并计划通过 MCP 标准实现 Airbnb 应用与外部 Agent 的互操作性。

  3. Hugging Face Blog52

    AllenAI 发布 Olmo-core 3:面向大规模 MoE 的开源训练基础设施

    AllenAI 发布 Olmo-core 3,这是一套专为扩展至万亿参数规模混合专家(MoE)模型设计的开源训练基础设施。该系统通过集成专家并行、流水线并行和分布式优化器等技术,在 NVIDIA B300 GPU 上实现了相比前代约 2.7 倍的训练吞吐量提升,并支持 MXFP8 低精度格式以进一步优化显存占用。

  4. The Verge · AI77

    OpenAI 发布 Dots 智能体以对抗 Meta Muse,但面临免费竞争挑战

    OpenAI 在 DevDay 大会上发布了由 GPT-6 Astra 驱动的 AI 智能体 Dots,旨在与 Meta 的 Muse 平台竞争。Dots 定位为“首席助理”或资深工程师,擅长处理长期任务和知识工作,但目前仅限 $20/月 Pro 及以上计划用户使用,而 Muse 提供免费的专用虚拟机。

    推荐理由:原文对比了 OpenAI Dots 与 Meta Muse 在定价、功能定位及安全策略上的差异,揭示了 AI Agent 领域免费模式与高端付费路线的竞争格局。

  5. The Decoder78

    Ataraxos AI 击败 Stratego 历史最佳选手 Niemeijer,终结人类最后堡垒之一

    新系统 Ataraxos 在 Stratego 游戏中击败了被认为是历史上最伟大玩家的 Jeroen Niemeijer,有效胜率达到 85%。该研究指出,Ataraxos 仅使用约 8000 美元的算力成本(16 块 Nvidia H100 GPU 运行一周加 4 块 GPU 四天),远低于此前 DeepMind 的 DeepNash 系统所需的数百万美元。

    推荐理由:原文详细对比了 Ataraxos 与 DeepNash 在算力成本上的巨大差异,并展示了其在 Stratego 中击败人类顶尖选手的具体数据。

  6. The Decoder78

    OpenAI 称阻止了窃取模型推理的攻击但 Azure 仍存漏洞

    OpenAI 表示已阻止针对其模型推理数据的提取攻击并关联到 Moonshot AI,但研究人员发现该攻击在 Microsoft Azure 上仍能成功获取 GPT-6 Astra 等模型的隐藏思维链。研究指出仅加固自有 API 无效,因为云服务商未同步实施同等保护,导致攻击者可通过防御较弱的平台绕过限制。

    推荐理由:原文揭示了模型推理数据在云端部署中的提取漏洞,指出不同平台防护差异带来的安全风险。

  7. Simon Willison42

    Matthew Green 指出智能体通过共享缓存传播载荷构成蠕虫风险

    Matthew Green 警告,劫持智能体的载荷与携带载荷的智能体结合可形成“蠕虫”。在隔离沙箱中,智能体能通过共享包缓存互相留下指令并改变接收者行为。若将包缓存替换为邮件、Slack 或 WhatsApp,并将独立部署的个人智能体(如 Muse)纳入其中,即具备蠕虫所需的全部要素。

  8. Latent Space78

    Latent Space 访谈 OpenAI 团队:反驳 Dwarkesh 关于 Computer Use 停滞的观点及解析新 API

    Latent Space 在 OpenAI DevDay 后访谈了 Computer Use 负责人 Ari Weinstein 和 API 产品负责人 Nikunj Handa,反驳了此前关于 Computer Use 进展缓慢的观点,指出其能力已发生巨大变化。

    推荐理由:文章通过访谈 OpenAI 团队,澄清了 Computer Use 的技术演进现状,并解析了 Decisions API 等开发者工具的设计逻辑。

  9. The Decoder86

    Google 发布 Gemini 4 Argon:缩小与 OpenAI 和 Anthropic 差距但未确立明显领先

    Google 发布新前沿模型 Gemini 4 Argon,在部分关键基准测试中超越竞争对手,但尚未确立全面领先地位。该模型目前仅向“可信网络防御者”等早期测试者开放,后续将逐步面向 API 客户和 Google AI Ultra 订阅用户推出。

    推荐理由:原文梳理了 Gemini 4 Argon 的基准测试表现、定价策略及分阶段开放计划,为评估其与竞品差距提供了具体数据参考。

  10. The Verge · AI87

    谷歌发布 Gemini 4 Argon 模型,初期仅限受信任网络防御者使用

    谷歌发布新一代前沿 AI 模型 Gemini 4 Argon,宣称其在软件工程、企业知识工作和网络安全防御等复杂工作流中具备前沿性能。目前该模型仅向一组“受信任的网络防御者”开放,谷歌正参与美国政府的自愿性预发布模型访问流程以逐步扩大权限。

    推荐理由:原文指出新模型在复杂工作流中具备前沿性能,但初期仅向受信任的网络安全防御者开放,并正在与美国政府进行预发布访问流程。

  11. Google DeepMind94

    Google DeepMind 发布 Gemini 4 Argon 模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,旨在提升复杂工作流中的深度推理能力,并已通过 Fairwind Program 向受信任的网络安全防御者推出。

    推荐理由:原文披露了 Gemini 4 Argon 在长上下文输出、软件工程基准及网络安全防御上的具体性能数据与分阶段开放策略,为评估前沿模型能力边界提供了直接依据。