跳到正文

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

61条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 21–40 条 · 共 61 条
5月16日周六
  1. Google DeepMind92

    Google DeepMind 发布 Gemini 3.5 Flash 模型

    Google DeepMind 正式发布 Gemini 3.5 系列并率先推出 Gemini 3.5 Flash 模型,该模型主打智能体(Agent)与编码能力,现已向全球用户开放。

    推荐理由:官方详细披露了 Gemini 3.5 Flash 在智能体任务与编码基准上的性能数据及开放入口,为评估其实际工作流替代能力提供了具体依据。

4月16日周四
3月31日周二
  1. Mistral AI63

    Mistral AI 发布 Spaces CLI:专为人类与智能体设计的命令行工具

    Mistral AI 推出名为 Spaces 的 CLI 工具,旨在解决开发者工具在同时服务人类用户和编码智能体时的兼容性问题。该工具确立了“每个交互式输入都有对应的 flag”、“状态必须显式化”以及“插件作为可内省的数据模型”等设计原则,并自动生成 context.json 和 AGENTS.md 文件以提供结构化项目上下文。

    推荐理由:Mistral AI 发布 Spaces CLI,通过为智能体设计显式接口和结构化上下文,展示了如何构建同时服务于人类开发者和 AI Agent 的工具。

3月17日周二
3月11日周三
  1. Mistral AI68

    Mistral AI 分享基于 Vibe 构建 Rails 自动测试智能体的实践

    Mistral AI 介绍了如何利用开源编码助手 Vibe 构建一个自主智能体,以自动生成和改进大型 Rails 单体应用中的 RSpec 测试。该方案通过仓库级 AGENTS.md 文件定义执行计划,结合针对不同文件类型的专用 SKILLS 文件和自定义工具(RuboCop 和 SimpleCov)来确保代码风格合规及测试覆盖率。

    推荐理由:原文详细拆解了基于Vibe构建Rails测试智能体的上下文工程、技能文件设计及LLM-as-a-judge评估方法,为自动化代码测试提供了可复用的技术路径。

2月13日周五
  1. Hugging Face Blog77

    Hugging Face 发布用于编写生产级 CUDA 内核的智能体技能

    Hugging Face 推出一个智能体技能,指导 Claude 和 Codex 等编码代理编写生产级 CUDA 内核。该技能封装了 GPU 架构优化、PyTorch 绑定及库集成知识,已在 LTX-Video 和 Qwen3-8B 上验证,生成的 RMSNorm 内核在 H100 上实现约 1.9x 的隔离加速比。

    推荐理由:原文提供了可直接安装的 CUDA 内核编写技能及实测基准,展示了智能体在特定硬件优化任务中的落地能力。

2月12日周四
  1. OpenAI News67

    OpenAI 发布 GPT-5.3-Codex-Spark 实时编码模型

    OpenAI 推出首个实时编码模型 GPT-5.3-Codex-Spark,生成速度提升 15 倍,支持 128k 上下文窗口。该模型目前以研究预览形式向 ChatGPT Pro 用户开放。

    推荐理由:官方发布了首款实时编码模型,提供了具体的速度提升倍数和上下文窗口参数,适合开发者评估其在编程场景下的响应效率。

2月5日周四
  1. OpenAI News70

    OpenAI 发布 GPT-5.3-Codex

    OpenAI 发布 GPT-5.3-Codex,这是一款专为 Codex 设计的智能体模型。它将前沿编码性能与通用推理相结合,旨在支持长周期的真实世界技术工作。

    推荐理由:官方明确该模型专为 Codex 设计,结合前沿编码与通用推理以支持长周期技术工作。

2月4日周三
  1. OpenAI News65

    OpenAI 发布 Codex App Server 支持双向通信与工具调用

    OpenAI 推出 Codex App Server,这是一个基于 JSON-RPC 的双向通信服务器,旨在让客户端应用与 Codex agent 进行交互。该服务器支持流式响应、工具调用审批以及会话管理,允许开发者构建自定义界面来驱动 Codex agent 执行编程任务。通过这一组件,用户可以将 Codex 的能力嵌入到 IDE、Web 应用或其他工作流中,实现更灵活的代码生成与修改体验。

    推荐理由:官方披露了 Codex App Server 的架构细节,开发者可据此评估如何集成其双向通信与工具调用能力。

1月28日周三
  1. Hugging Face Blog64

    Hugging Face 发布 upskill 工具:用 Claude 生成 CUDA 内核技能并赋能开源小模型

    Hugging Face 推出 `upskill` 工具,通过让 Claude Opus 4.5 等前沿模型解决复杂任务(如编写 CUDA kernels)来生成 Agent Skills,并将这些技能文件迁移给更便宜或本地的开源模型使用。

    推荐理由:原文演示了利用大模型生成 CUDA 内核技能并迁移至小模型的完整流程,提供了可复用的 upskill 工具链与评估方法。

  2. Mistral AI68

    Mistral 发布 Vibe 2.0 终端编码智能体及 Devstral 2 模型更新

    Mistral AI 发布 Mistral Vibe 2.0,这是其终端原生编码智能体的重大升级,由 Devstral 2 模型家族驱动。新版本支持构建自定义子代理、执行前多选项澄清、通过斜杠命令加载技能以及统一代理模式,并包含自动更新功能。

    推荐理由:Mistral Vibe 2.0 引入自定义子代理和斜杠命令技能,配合 Devstral 2 模型升级,为终端原生编码提供了更灵活的工作流配置。

12月18日周四
  1. OpenAI News78

    OpenAI 发布 GPT-5.2-Codex 编程模型

    OpenAI 推出其最先进的编程模型 GPT-5.2-Codex。该模型支持长程推理和大规模代码转换,并增强了网络安全相关能力。

    推荐理由:官方明确该模型具备长程推理、大规模代码转换及增强的网络安全能力,为开发者评估其在复杂工程任务中的表现提供了核心依据。

12月17日周三
  1. Google DeepMind86

    Google DeepMind 发布 Gemini 3 Flash:兼顾前沿智能与速度

    Google DeepMind 发布 Gemini 3 Flash,旨在以更低成本和更高速度提供接近 Pro 级别的前沿智能。该模型在 GPQA Diamond 得分 90.4%,SWE-bench Verified 得分 78%,比 Gemini 2.5 Pro 快 3 倍且平均少用 30% token。

    推荐理由:原文给出了 Gemini 3 Flash 在多项基准测试中的具体分数、定价及与上一代模型的性能对比,读者可据此评估其在速度与成本平衡上的实际竞争力。

12月9日周二
11月19日周三
10月7日周二
  1. Hugging Face Blog68

    BigCodeArena发布:支持实时执行的代码生成模型评估平台

    BigCode项目推出BigCodeArena,这是首个允许用户通过实际运行代码来评估和比较AI代码生成模型的众包平台。该平台支持Python、JavaScript等10种语言及React、PyGame等8种执行环境,用户可提交任务并投票选择表现更好的模型。

    推荐理由:BigCodeArena通过引入实时执行反馈解决了代码生成评估中静态对比的局限,其数据揭示了不同模型在特定运行环境下的鲁棒性差异。

10月6日周一
  1. OpenAI News67

    OpenAI Codex 正式全面可用

    OpenAI Codex 现已正式全面可用(Generally Available),面向开发者推出多项新功能。此次更新包括 Slack 集成、Codex SDK 以及包含使用仪表板和工作区管理在内的管理员工具,旨在提升 Codex 在大规模场景下的易用性和可管理性。

    推荐理由:Codex 正式全面开放并新增 Slack 集成、SDK 及管理工具,为开发者提供了规模化使用与管理的完整方案。