Google 发布 Gemini 4 Argon:缩小与 OpenAI 和 Anthropic 差距但未确立明显领先
Google 发布新前沿模型 Gemini 4 Argon,在部分关键基准测试中超越竞争对手,但尚未确立全面领先地位。该模型目前仅向“可信网络防御者”等早期测试者开放,后续将逐步面向 API 客户和 Google AI Ultra 订阅用户推出。
推荐理由:原文梳理了 Gemini 4 Argon 的基准测试表现、定价策略及分阶段开放计划,为评估其与竞品差距提供了具体数据参考。
Google 发布新前沿模型 Gemini 4 Argon,在部分关键基准测试中超越竞争对手,但尚未确立全面领先地位。该模型目前仅向“可信网络防御者”等早期测试者开放,后续将逐步面向 API 客户和 Google AI Ultra 订阅用户推出。
推荐理由:原文梳理了 Gemini 4 Argon 的基准测试表现、定价策略及分阶段开放计划,为评估其与竞品差距提供了具体数据参考。
Anthropic 今日发布 Claude Sonnet 5.5,官方称其运行速度提升超过30%,多数工作负载成本降低至多30%。该模型定价与 Sonnet 5 相同,但在各项基准测试中表现更优。
推荐理由:作者实测新模型在编码任务上的表现与成本变化,并复现了特定思考强度下的失败案例。
Anthropic 发布 Claude Opus 5.5,OpenAI 推出 GPT-6 Sol 和 GPT-6 Luna,引发新一轮模型价格竞争。GPT-6 Luna 输入价格降至 $0.10/M,为 OpenAI 最便宜的高性能模型之一;Opus 5.5 降价 20% 并优化了沟通风格,但在 max 思考模式下因过度推理导致输出 token 耗尽而失败。
推荐理由:作者通过实测对比了新模型的价格降幅与推理表现,揭示了 Opus 5.5 max 模式因过度思考导致输出截断的缺陷。