跳到正文

全部动态

今日 7 条
今天10月2日周五
  1. AWS Machine Learning Blog40

    Amazon Quick 推出 Live Data in Apps,支持 AI 应用实时查询受治理数据

    Amazon Quick 发布 Live Data in Apps 功能,允许 AI 构建的应用程序实时查询受治理的 Quick Sight 数据集。该功能取代了静态快照,支持 SPICE 和 Direct Query 模式,并自动继承行级与列级安全规则。用户通过自然语言描述即可生成应用,确保每次打开时数据均为最新且符合权限控制。

  2. AWS Machine Learning Blog42

    AWS 使用上下文多臂老虎机优化 Amazon Payments 转化漏斗

    Amazon Payments 在 Amazon SageMaker AI 上部署多目标上下文多臂老虎机(MAB)以个性化产品获取漏斗。七周 A/B 测试显示,特定客户群体最终转化率提升高个位数百分比,但另一群体无改善,表明瓶颈在于内容而非模型。该方案采用 LinUCB 算法,基于行为信号向量进行实时决策与探索平衡。

  3. AWS Machine Learning Blog47

    基于 Amazon Bedrock AgentCore 构建环境感知智能体:从事件驱动信号到人在回路工作流

    Amazon Bedrock AgentCore 支持构建环境感知智能体,该模式通过监听 S3 或 EventBridge 等事件流自动触发任务,并利用 ask_human 工具实现人在回路交互。此方案结合 Lambda 与 DynamoDB 形成无服务器架构,解决了传统聊天式智能体无法并行处理基础设施事件的局限,提升了自动化流程的可靠性与扩展性。

10月1日周四
  1. AWS Machine Learning Blog25

    uniopen 定制 Amazon Nova 2 Lite 实现零售内容审核生产部署

    uniopen 通过监督微调将 Amazon Nova 2 Lite 适配至其零售审核策略,并在 Amazon SageMaker AI 中完成训练与部署。该方案结合提示词优化,在包含 737 个对话窗口的测试集上评估行为分类与主体识别性能。架构采用人工验证反馈闭环,利用硬/软门控机制控制模型晋升,确保生产环境下的合规性与稳定性。

  2. Hugging Face Blog52

    AllenAI 发布 Olmo-core 3:面向大规模 MoE 的开源训练基础设施

    AllenAI 发布 Olmo-core 3,这是一套专为扩展至万亿参数规模混合专家(MoE)模型设计的开源训练基础设施。该系统通过集成专家并行、流水线并行和分布式优化器等技术,在 NVIDIA B300 GPU 上实现了相比前代约 2.7 倍的训练吞吐量提升,并支持 MXFP8 低精度格式以进一步优化显存占用。

  3. Google DeepMind94

    Google DeepMind 发布 Gemini 4 Argon 模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,旨在提升复杂工作流中的深度推理能力,并已通过 Fairwind Program 向受信任的网络安全防御者推出。

    推荐理由:原文披露了 Gemini 4 Argon 在长上下文输出、软件工程基准及网络安全防御上的具体性能数据与分阶段开放策略,为评估前沿模型能力边界提供了直接依据。

9月30日周三
  1. Google DeepMind73

    Google DeepMind 推出 SynthID Bio 用于 AI 生成蛋白质的水印技术

    Google DeepMind 发布 SynthID Bio,这是一套专为合成生物学设计的水印方法,能在不损害生物功能的前提下将不可察觉的数字签名直接嵌入到合成的物理蛋白质中。

    推荐理由:原文展示了在保持蛋白质生物功能前提下嵌入数字水印的技术路径,为合成生物学提供了可验证的溯源手段。

  2. Hugging Face Blog51

    Hugging Face 发布 Open TTS Leaderboard 支持多语言与声音克隆评测

    Hugging Face 推出 Open TTS Leaderboard,采用 WER、CER、RTFx 和 TTFA 等客观指标对开源文本转语音模型进行标准化评估。该榜单覆盖多语言及声音克隆能力,旨在解决现有竞技场式评测难以跟上模型发布速度且开源模型代表性不足的问题。用户可通过 Listen 标签页试听生成音频并投票反馈,同时可在 Streaming 标签页查看不同硬件下的首音频延迟表现。

  3. Google Research38

    Google Research 提出 Diffusion Controller 框架统一 AI 图像生成控制

    Google Research 推出 Diffusion Controller 框架,将扩散模型去噪过程重构为连续控制问题以统一引导与微调。该框架通过轻量级“转向阻尼器”网络动态调整生成轨迹,在保持基础模型画质稳定的同时精准对齐用户意图。实验显示其完全解锁版本对基线模型取得 90% 胜率,有效解决黑盒模型难以精细控制的痛点。

9月29日周二
  1. Hugging Face Blog70

    NVIDIA Kumo Tabular 开源表格基础模型发布

    NVIDIA 发布开源表格基础模型 Kumo Tabular,支持分类和回归任务,单次前向传播即可完成预测,无需训练、调优或特征工程。该模型提供 28M 至 215M 三种参数规模,完全基于人工合成数据预训练,采用 OpenMDW-1.1 许可证允许商用。

    推荐理由:原文展示了无需训练即可预测表格数据的开源基础模型及其在多个基准测试中的精度效率表现,为传统机器学习工作流提供了新的免调优替代方案。

  2. Microsoft Research60

    微软研究院发布 Quine:面向生物学复杂性的 AI 研究系统

    微软研究院发布 Quine,这是一个结合生物学世界模型与交互式工具链的 AI 研究系统,旨在连接模型、科学工具、文献及研究人员。该系统在胰腺导管腺癌(PDAC)研究中应用,仅用一个周末即完成了从缩小化合物搜索空间到确定候选药物的过程,并验证了多个排名靠前的化合物能驱动肿瘤细胞状态转变。

    推荐理由:微软研究院推出Quine,通过多模态世界模型与实验闭环加速生物发现,并在胰腺癌研究中验证了化合物筛选效率。

  3. OpenAI News67

    OpenAI 发布新模型

    OpenAI 通过官方新闻渠道发布了一款新模型。该消息由 OpenAI News RSS 源提供,具体模型名称、版本及详细能力指标未在标题中披露。

    推荐理由:官方直接发布了新模型,读者可据此获取最新的能力参数与接入方式。

9月28日周一
  1. Mistral AI45

    Mistral 在慕尼黑设立德国中心,推进工业 AI 与欧洲主权算力

    Mistral 在慕尼黑开设新中心,组建专门团队研发 Physics AI 和 Industrial AI。该公司计划到 2030 年建设 1 吉瓦欧洲算力容量,并依托开源权重架构确保数据留在客户基础设施内。目前 Mistral 正与 BMW、Siemens Energy 及慕尼黑工业大学合作,利用其收购的 Emmi AI 技术优化流体动力学模拟等工业应用。

  2. Hugging Face Blog80

    Holo4:驱动通用计算机使用智能体的新模型系列

    Holo4 是 H Company 推出的新一代智能体模型系列,包含 27B 密集型和 35B-A3B MoE 两种规格,现已上线 H Models API。该模型通过监督学习和强化学习训练,能够灵活调用 GUI、代码、MCP 和 API 等多种接口执行复杂任务。

    推荐理由:Holo4 系列模型发布,提供 27B 和 35B-A3B 两种规格,支持 GUI、代码、MCP 和 API 多接口交互,在 OSWorld 2.0 等基准测试中表现优异且成本更低。

9月26日周六
  1. GitHub Blog · AI & ML63

    GitHub Copilot 应用入门:如何用 canvases 构建自定义工作流

    GitHub Copilot 应用推出 canvases 功能,允许用户通过 `/create-canvas` 技能用自然语言描述生成可定制的双向交互界面。该界面支持看板、清单等多种形态,用户与智能体可实时同步操作状态,无需编写代码即可创建并复用扩展工具。

    推荐理由:原文演示了如何通过自然语言描述生成双向交互界面,为构建个性化智能体工作流提供了具体方法。

9月25日周五
  1. GitHub Blog · AI & ML68

    GitHub Copilot 提出用 canvas 替代聊天作为主要交互界面

    GitHub Copilot 推出 canvas 功能,允许用户在应用内创建全栈自定义界面以替代传统聊天窗口进行交互。canvas 支持双向通信和本地代码执行,可用于构建如 Connect 4 游戏、Winget 包管理器等工具,从而减少不必要的 token 消耗并提升开发工作流的自动化程度。

    推荐理由:文章通过具体案例展示了如何利用 canvas 构建自定义交互界面,帮助开发者优化与 AI 智能体的协作流程。

  2. Google Research60

    Google Research 发布 AI 视频联合导演框架以自动化连贯长视频生成

    Google Research 推出名为“AI video co-director”的统一多智能体框架,旨在解决现有扩散模型在生成长篇叙事视频时面临的语义漂移和级联失败挑战。

    推荐理由:Google Research 提出基于 Gemini 和 Veo 的多智能体框架,通过全局优化和世界状态跟踪解决长视频生成的语义漂移问题。

  3. GitHub Blog · AI & ML78

    GitHub Security Lab 发布 AI 驱动的模糊测试工具 Taskflow Agent

    GitHub Security Lab 推出 Fuzzing Taskflow,这是一个用于 C/C++ 项目的自主模糊测试流水线。该工具利用 LLM Agent 自动识别入口点、编写 AFL++ Harness、分析覆盖率报告并分诊崩溃,最终生成漏洞报告。用户只需指定 GitHub 仓库即可启动,但需在隔离环境中运行以防范提示注入风险。

    推荐理由:GitHub Security Lab 开源了基于 LLM Agent 的自动化模糊测试流水线,展示了如何将编写 Harness、分析覆盖率和分诊崩溃等重复性安全工作交给 AI 处理。

  4. Google DeepMind73

    Google DeepMind 推出 Gemini 3.8 Live with Live Avatar 实时视觉化身功能

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,将低延迟流式视频生成与原生对话模型结合,为企业用户提供具备实时视觉呈现的交互式 AI 体验。

    推荐理由:原文详述了实时视觉化身在对话中的同步机制与异步工具调用能力,为评估企业级多模态交互体验提供了具体技术细节。

9月24日周四
  1. GitHub Blog · AI & ML55

    GitHub Copilot App 如何渲染包含百万行变更的超大 Pull Request

    GitHub Copilot App 重构了 Pull Request 视图以支持包含 2,200 个文件和超过 100 万行变更的超大 PR 流畅渲染。针对代码行高度确定但评论块高度动态变化的矛盾,团队将文档高度拆分为确定性代码几何域和动态块几何域,并采用空闲滚动门控的单次批量测量调度器替代逐块 ResizeObserver 以避免布局反馈循环。

  2. Google DeepMind73

    Google DeepMind 发布 Private AI Compute 新架构:实现安全的服务器端持久记忆

    Google DeepMind 宣布在 Private AI Compute 平台引入新的服务器端持久记忆功能,旨在解决云端 AI 助手长期连续性与严格隐私标准之间的矛盾。

    推荐理由:原文详述了通过硬件隔离和端到端加密实现云端持久记忆的技术架构,为理解隐私保护与跨设备连续性如何兼得提供了具体方案。