Anthropic 红队评估 GLM-5.3 与 Claude Mythos Preview 的漏洞利用能力
Anthropic 前沿红队报告指出,GLM-5.3 和 Claude Mythos Preview 在利用漏洞方面均展现出显著能力,其中 Claude Mythos Preview 在特定基准测试中表现优于 GLM-5.3。该评估基于对多个模型在复杂任务中的实际表现对比,强调了新一代模型在网络安全领域的潜在影响。
Anthropic 前沿红队报告指出,GLM-5.3 和 Claude Mythos Preview 在利用漏洞方面均展现出显著能力,其中 Claude Mythos Preview 在特定基准测试中表现优于 GLM-5.3。该评估基于对多个模型在复杂任务中的实际表现对比,强调了新一代模型在网络安全领域的潜在影响。
Google发布Gemini 3 Pro与Flash,前者在MathArena Apex达23.4% SOTA并登顶LMArena,后者以更低成本实现Pro级推理。开源模型Gemma 3增强多模态能力,Google Antigravity推动AI辅助软件开发。