Gemini 3.5 Flash 原生集成计算机使用功能
Google DeepMind 宣布将计算机使用(computer use)作为内置工具集成到 Gemini 3.5 Flash 中,此前该功能仅作为独立的 Gemini 2.5 模型提供。
推荐理由:原文说明计算机使用能力已原生集成至 Gemini 3.5 Flash,并提供了针对提示注入风险的对抗训练及企业级安全防护机制。
Google DeepMind 宣布将计算机使用(computer use)作为内置工具集成到 Gemini 3.5 Flash 中,此前该功能仅作为独立的 Gemini 2.5 模型提供。
推荐理由:原文说明计算机使用能力已原生集成至 Gemini 3.5 Flash,并提供了针对提示注入风险的对抗训练及企业级安全防护机制。
PaddlePaddle 在 Hugging Face 发布 PP-OCRv6,提供 tiny、small 和 medium 三个档位,参数量从 1.5M 到 34.5M。
OpenAI 发布了一项关于利用大模型辅助诊断罕见遗传病的研究成果。该研究展示了模型在解决此前未确诊的复杂病例中的潜力,体现了 AI 在医疗健康领域的具体应用价值。
Google Research 基于 Earth AI 框架推出英国乡村矢量数据集,将高分辨率卫星影像转化为树篱、石墙等生态特征的精确清单。该方案利用 RSF Vision-Transformer 骨干网络处理超 130,000 km² 区域,解决传统像素地图无法支持碳核算与景观规划的难题。
Google Research 发布 JAMA Dermatology 研究,显示 AI 辅助工具使消费者识别皮肤疾病名称的准确率从 8% 提升至 23%,近三倍于传统搜索。尽管命名能力显著增强,用户在确定后续医疗步骤方面仍面临挑战,表明人类在利用 AI 进行健康决策时的认知因素至关重要。
Google DeepMind 发布最新音频模型 Gemini 3.5 Live Translate,支持自动检测 70 多种语言并生成保留说话人语调、节奏和音高的自然翻译语音。
推荐理由:该模型支持70多种语言的近实时语音到语音翻译,并已在开发者API、企业会议及消费级应用中开放体验。
Google DeepMind 发布 Gemma 4 12B,这是一款旨在笔记本电脑上运行的高性能多模态模型。它采用独特的无编码器统一架构,将视觉和音频输入直接融入 LLM 主干网络,支持原生音频输入。
推荐理由:该模型采用无编码器统一架构,在16GB显存设备上实现接近26B MoE的多模态推理能力,适合关注本地部署效率的开发者。
作者演示了编码智能体如何通过读取 Gradio Space 暴露的 `agents.md` 文件,自动调用 `ideogram-ai/ideogram4` 生成图像并串联 `VAST-AI/TripoSplat` 进行 3D Gaussian splat 重建,最终部署为静态 Space。
推荐理由:展示了利用 agents.md 让智能体自动串联图像生成与3D重建Space的完整流程,为构建多媒体应用提供了可复用的集成方法。
Google DeepMind 公布在塞拉利昂进行的预注册随机对照试验结果,使用 Gemini 驱动的 Guided Learning 工具使学生在八周内数学成绩提升 0.258 个标准差,相当于 1.2 至 1.7 年的常规学习进度。
推荐理由:原文披露了塞拉利昂预注册试验数据,显示AI辅助教学显著提升数学成绩且学生主动寻求理解而非答案。
Google Research 在 Nature 发表研究,推出名为 PHRM 的被动心率监测系统,利用智能手机前置摄像头在日常使用中估算心率和静息心率。该系统在实验室和真实场景下均达到 MAPE < 10% 的精度,且在不同肤色群体中表现一致,其每日静息心率估算误差小于 5 bpm,媲美可穿戴设备。
推荐理由:原文展示了基于智能手机前置摄像头的被动心率监测系统,提供了跨肤色的高精度验证数据及开源数据集,为无穿戴设备的心血管健康追踪提供了可复用的技术方案。
NVIDIA 发布 Nemotron 3.5 Content Safety,这是一个基于 Gemma 3 4B IT 微调的统一多模态、多语言内容安全模型。它支持自定义企业策略执行和可选的可审计推理轨迹(THINK Mode),在保持低延迟的同时实现了跨语言和图文的综合安全评估。
推荐理由:该模型将多模态、多语言与自定义策略执行统一于单次推理,并开源了包含真实图像的训练数据集,为企业级内容安全提供了可审计且低延迟的解决方案。
Hugging Face 推出 OlmoEarth v1.1 地球观测模型家族,通过优化 Transformer token 序列长度,将计算成本降低至上一代的三分之一。该版本在保持与 OlmoEarth v1 相当性能的同时,显著提升了推理效率,支持 Base、Tiny 和 Nano 三种规格,使大规模卫星影像处理更经济高效。
Google DeepMind 宣布其通用世界模型 Project Genie 新增基于 Google Street View 的实景锚定能力,允许用户选择美国境内的真实地点生成互动虚拟环境。
推荐理由:Project Genie 接入 Street View 真实影像,让 AI 生成的虚拟环境能锚定现实地点,为智能体训练和创意探索提供新路径。
Google DeepMind 推出 Gemini Omni Flash,这是 Omni 系列的首个模型,支持从图像、音频、视频和文本等任意输入生成高质量视频。
推荐理由:原文详细说明了 Gemini Omni Flash 支持自然语言对话式视频编辑及多模态输入生成,并给出了具体的分发渠道和订阅权限。
Google DeepMind 正式推出 Gemini for Science,这是一套旨在扩展科学探索规模与精度的工具集合。该计划包含 Google Labs 上的三个实验性原型:基于 Co-Scientist 的假设生成、结合 AlphaEvolve 和 ERA 的计算发现,以及利用 NotebookLM 实现的文献洞察。
推荐理由:Google DeepMind 推出 Gemini for Science,包含三个实验性工具和科学技能包,旨在通过 AI 智能体加速科学研究的核心步骤。
Google DeepMind 宣布在 Search、Gemini、Chrome、Pixel 和 Cloud 中扩展内容透明度和验证工具,以帮助用户理解网络内容的创建和编辑方式。
推荐理由:官方详细说明了 SynthID 和 C2PA 在搜索、浏览器及云端的集成进展,并发布了新的 AI 内容检测 API,为开发者提供了识别生成内容的具体工具。
Google DeepMind 的 Co-Scientist 工具被用于协助剑桥大学 Clare Bryant 教授团队,通过生成和排序假设来识别导致严重疾病的分子开关。该工具帮助团队将原本需两到三年的实验工作缩短至六个月,并精准定位到具体的氨基酸突变目标以进行细胞系测试。
Google DeepMind 发布文章说明其 AI 天气模型 WeatherNext 协助美国国家飓风中心(NHC)成功预测了飓风梅丽莎的迅速增强和登陆。该模型在飓风仍为一级时,便以 80% 的置信度提前五天预测出其将以五级强度登陆牙买加,这是首次从如此低的风速起点成功预测达到五级强度的风暴。
推荐理由:原文通过飓风梅丽莎案例,展示了 WeatherNext 在提前五天预测五级强度登陆方面的具体表现及与传统模型的对比优势。
Google DeepMind 正式发布 Gemini 3.5 系列并率先推出 Gemini 3.5 Flash 模型,该模型主打智能体(Agent)与编码能力,现已向全球用户开放。
推荐理由:官方详细披露了 Gemini 3.5 Flash 在智能体任务与编码基准上的性能数据及开放入口,为评估其实际工作流替代能力提供了具体依据。
Google DeepMind 宣布启动 AI co-clinician 研究计划,旨在通过“三元护理”模式让 AI 在医生监督下协助患者。该系统在 98 个初级保健查询中实现 97 例无关键错误,并在开放式药物问答基准上超越现有前沿模型。
推荐理由:原文披露了AI co-clinician在真实临床查询中的零关键错误率及多模态实时交互能力,展示了其作为辅助工具而非替代者的具体边界。
Google Research 发布博客,详细介绍其内部科学家及学术合作伙伴如何利用 Empirical Research Assistance (ERA) 工具推进科学研究。
推荐理由:原文展示了ERA在流行病学预测、宇宙学求解及神经科学建模中的具体应用案例,为AI辅助科研提供了可参考的落地路径。
NVIDIA 发布 Nemotron 3 Nano Omni,这是一款支持文本、图像、视频和音频的全模态理解模型。该模型采用 Mamba-Transformer MoE 混合骨干网络,在 OCRBenchV2 和 WorldSense 等基准测试中表现优异,并针对长文档分析和智能体计算机使用进行了优化。BF16、FP8 和 NVFP4 检查点已在 Hugging Face 开放下载。
推荐理由:原文给出了混合架构细节与多基准实测数据,读者可以据此评估其在长文档和音视频联合理解任务中的实际能力边界。
Google Research 宣布在 Google Photos 的 Auto frame 功能中集成新的机器学习方法,通过理解场景空间布局并利用生成式 AI 想象新视角,实现拍摄后照片的自动重新构图。
推荐理由:Google Photos 的 Auto frame 功能引入基于 3D 场景重建的新方法,能自动调整照片视角并修复广角畸变。
Sentence Transformers 库支持对处理文本、图像、音频和视频的多模态嵌入及重排序模型进行训练或微调。以 Qwen3-VL-Embedding-2B 为例,通过 Visual Document Retrieval 数据集微调后,NDCG@10 从 0.888 提升至 0.947,性能超越参数量大其 4 倍的现有模型。
推荐理由:原文提供了微调多模态嵌入模型的具体代码和Matryoshka训练策略,读者可据此复现视觉文档检索任务并优化部署效率。
Google Research 发布名为 Vantage 的研究实验,旨在利用生成式 AI 在模拟环境中创建对话,以评估高中和大学生的“未来就绪”技能(如批判性思维、协作和创造性思维)。
Google DeepMind 推出 Gemini Robotics-ER 1.6,这是一款专为机器人设计的高层推理模型,显著提升了空间推理和多视角理解能力。该模型新增了仪表读取功能,能够解读复杂压力表和液位计,并在指向、计数及任务成功检测方面优于前代版本。
推荐理由:官方详细拆解了空间推理与仪表读取等核心能力,并给出了 API 入口及开发者示例,适合评估其在工业巡检场景的落地潜力。
Sentence Transformers 库发布 v5.4 版本,新增对文本、图像、音频和视频的多模态嵌入及重排序支持。用户可通过熟悉的 API 进行跨模态相似度计算和混合模态文档排名,适用于视觉文档检索和多模态 RAG 场景。该版本集成了 Qwen3-VL、NVIDIA Nemotron 等主流多模态模型,并提供了详细的安装指南和使用示例。
推荐理由:Sentence Transformers v5.4 引入多模态嵌入与重排序能力,开发者可用统一 API 处理文本、图像及音视频,简化跨模态检索流程。
Google DeepMind 正式推出 Gemma 4 系列开源大模型,包含 E2B、E4B、26B MoE 和 31B Dense 四种规格,采用 Apache 2.0 许可证。
推荐理由:Google DeepMind 发布 Gemma 4 系列开源模型,提供从移动端到工作站的多种尺寸及 Apache 2.0 许可,展示了其在智能体工作流和边缘计算上的最新进展。
Gemma 4 系列多模态模型正式发布,包含 E2B、E4B、12B Unified、31B 和 26B A4B 五种尺寸,支持图像、文本和音频输入,采用 Apache 2.0 许可证。
推荐理由:原文给出了五种尺寸的多模态架构细节与跨框架部署方案,读者可据此评估其在端侧推理和智能体工作流中的实际可用性。
Technology Innovation Institute (TII) 发布 Falcon Perception(0.6B 参数)和 Falcon OCR(0.3B 参数),两者均采用单一早期融合 Transformer 架构处理图像补丁与文本。
推荐理由:原文展示了早期融合架构在开放词汇分割与OCR任务上的性能优势及推理细节,为小参数模型替代复杂视觉管线提供了可复用的技术路径。
IBM 在 Hugging Face 发布 Granite 4.0 3B Vision,这是一款基于 Apache 2.0 许可的紧凑视觉语言模型,专为企业文档理解设计。
Google DeepMind 推出由 Gemini 驱动的 AI 指针实验演示,旨在让光标具备理解用户指向内容及意图的能力。该功能遵循四项交互原则,允许用户通过简单的指向和语音指令(如“显示路线”或“总结此段”)跨应用调用 AI,无需在独立窗口间切换。
推荐理由:官方展示了基于 Gemini 的 AI 指针原型,将上下文理解融入光标交互,为 Chrome 和 Googlebook 带来无需复杂提示词的自然操作体验。
Google DeepMind 推出 Lyria 3 Pro,这是其最先进的音乐生成模型,支持创建长达 3 分钟的曲目,并能理解前奏、主歌、副歌等音乐结构以提供更强的定制化和创意控制。
推荐理由:Lyria 3 Pro 支持长达 3 分钟的曲目生成并具备结构感知能力,同时接入 Vertex AI、Gemini 等多个平台,为不同规模的用户提供了更精细的音乐创作控制。
Google Research 推出 Vibe Coding XR 工作流,利用 Gemini 和 XR Blocks 框架将自然语言直接转化为功能完整的 Android XR 应用。该系统通过长上下文推理与专用系统提示词处理空间逻辑,能在 60 秒内生成具备物理感知的原型,显著加速 XR 交互设计与教育体验的开发验证。
Google Research 在 Earth AI 计划中推出 S2Vec,这是一种用于学习环境通用嵌入的自监督框架。该模型利用 S2 Geometry 栅格化地理数据并通过掩码自动编码(MAE)进行训练,无需人工标签即可预测人口密度等社会经济指标。评估显示,S2Vec 在社会经济预测任务中与基于图像的基线方法表现相当,尤其在地理外推方面具有优势。
Google Research 在 The Check Up 活动中概述了其 AI 技术在医疗健康领域的最新突破,涵盖个性化护理、临床协作、开发者生态、公共卫生及生物医学发现五大方向。
Google Research 与英国国家医疗服务体系(NHS)合作开展 AIMS 研究,并在 Nature Cancer 发表两项伴生研究,评估基于 AI 的乳腺癌检测系统在筛查工作流中的表现。
推荐理由:Google Research 联合 NHS 发表两项 Nature Cancer 研究,证实 AI 在乳腺癌筛查中可提升检出率并显著降低放射科医生工作负荷。
H Company 发布 Holotron-12B,这是一个基于 NVIDIA Nemotron-Nano-2 VL 后训练的多模态计算机使用模型。该模型采用混合 SSM 和注意力机制,在单张 H100 GPU 上实现了比 Holo2-8B 高 2 倍以上的吞吐量,并在 WebVoyager 基准测试中将性能从 35.1% 提升至 80.5%。
Mistral AI 发布 Mistral Small 4,这是首个将 Magistral(推理)、Pixtral(多模态)和 Devstral(智能体编码)能力统一于一体的 Mistral 模型。
推荐理由:Mistral Small 4 将推理、多模态和编码能力统一于单一开源模型,并提供了具体的架构参数与效率对比数据。
Google Research 宣布在 Flood Hub 平台上线基于 AI 的城市山洪预报功能,可提前 24 小时预测风险。该模型利用 Gemini 从公开新闻报道中提取历史洪水事件以构建 Groundsource 数据集,解决了缺乏物理水位计数据的难题。
推荐理由:原文介绍了基于新闻数据构建训练集并实现全球城市洪水预测的技术路径,展示了在缺乏传统水文监测地区的应用潜力。