跳到正文

#Google

今日 0 条
10月30日周四
  1. Google Research68

    Google Research 提出可证明隐私洞察系统以分析生成式 AI 使用

    Google Research 推出“可证明隐私洞察”(PPI)系统,利用大语言模型、差分隐私和可信执行环境分析非结构化生成式 AI 数据。该系统已在 Pixel Recorder 应用中部署,使用开源 Gemma 3 模型在 TEE 内对转录文本进行分类聚合,确保原始数据不离开安全边界且输出具备用户级差分隐私保证。相关代码及机密联邦分析栈已开源,允许外部验证服务器端处理仅执行隐私保护计算。

    推荐理由:原文详述了结合大语言模型、差分隐私与可信执行环境的可证明隐私洞察系统,为分析端侧生成式 AI 数据提供了兼顾透明度与用户级隐私保护的技术路径。

10月28日周二
10月23日周四
  1. Google Research68

    Google Earth AI 发布新基础模型与地理空间推理智能体

    Google Earth AI 推出新的图像和人口基础模型及基于 Gemini 的地理空间推理智能体,旨在通过跨模态推理解决复杂的行星尺度问题。新模型在多个公开地球观测基准上达到 SOTA,其中文本图像搜索平均提升超 16%,零样本目标检测准确率翻倍。

    推荐理由:原文展示了基础模型与智能体协同在复杂地理空间推理中的性能提升,为开发者提供了评估其解决现实世界问题能力的具体基准。

10月16日周四
9月4日周四
  1. Hugging Face Blog80

    Google 发布 EmbeddingGemma:面向端侧的高效多语言嵌入模型

    Google DeepMind 发布 EmbeddingGemma,这是一款拥有 308M 参数、支持 100 多种语言的开源多语言文本嵌入模型。该模型基于 Gemma3 架构并采用双向注意力机制,量化后内存占用低于 200 MB,在 MTEB 排行榜上位居同尺寸纯文本模型前列。

    推荐理由:原文展示了308M参数模型在MMTEB上的表现及多框架集成方案,读者可据此评估其在移动端RAG和检索任务中的落地可行性。

7月23日周三
  1. Hugging Face Blog42

    Hugging Face 开源 TimeScope 基准测试长视频多模态模型理解能力

    Hugging Face 推出开源基准 TimeScope,通过向1分钟至8小时视频中插入5-10秒“针”片段,评估视觉语言模型的局部检索、信息合成及细粒度时间感知能力。该基准揭示 Gemini 2.5-Pro 等前沿模型在长视频时序理解上仍存在显著短板,暴露了当前模型宣称的长上下文处理能力与实际表现间的差距。

6月26日周四
  1. Hugging Face Blog84

    Gemma 3n正式登陆开源生态,支持transformers、MLX等主流框架

    Gemma 3n现已全面支持transformers、timm、MLX、llama.cpp、Ollama等主流开源库,实现本地化多模态运行。该模型包含E2B和E4B两种规格,通过Per-Layer Embeddings技术将实际5B/8B参数的显存占用降至2GB/3GB,并首次引入MobileNet-v5视觉编码器与USM音频编码器。

    推荐理由:原文详细列出了Gemma 3n在主流开源库中的集成方式及显存优化原理,为开发者提供了从推理到微调的完整落地路径。

3月12日周三
  1. Hugging Face Blog92

    Google 发布 Gemma 3:支持多模态、140+语言及128k上下文的开源大模型

    Google 发布新一代开源多模态大模型 Gemma 3,包含 1B、4B、12B 和 27B 四种参数规模。除 1B 版本仅支持文本外,其余版本均支持图像输入,上下文窗口最高达 128k tokens,并支持 140 多种语言。

    推荐理由:原文详细列出了Gemma 3各尺寸参数、上下文长度及多语言支持,并提供了在Hugging Face生态中的具体部署与推理代码示例。

2月21日周五
2月19日周三
12月20日周五
  1. Hugging Face Blog62

    Artificial Analysis 发布 Big Bench Audio 数据集以评估音频推理能力

    Artificial Analysis 发布 Big Bench Audio 数据集,用于评估音频语言模型的推理能力。该数据集改编自 Big Bench Hard,包含 1000 个音频问题,涵盖逻辑演绎、导航和计数等类别。

    推荐理由:原文通过对比不同音频处理模式,量化了原生语音模型在复杂推理任务上的性能落差,为评估语音智能体能力提供了具体基准数据。

12月5日周四
  1. Hugging Face Blog78

    Hugging Face 介绍 Google 发布的 PaliGemma 2 视觉语言模型

    Hugging Face 博客介绍了 Google 新发布的 PaliGemma 2 视觉语言模型,该模型结合了 SigLIP 图像编码器与 Gemma 2 语言模型,提供 3B、10B 和 28B 三种参数规模,并支持 224x224、448x448 和 896x896 多种输入分辨率。

    推荐理由:原文给出了PaliGemma 2的多尺寸变体、分辨率支持及量化性能数据,读者可据此评估其在不同算力条件下的微调潜力与部署成本。

11月19日周二
8月19日周一
7月31日周三
7月9日周二
6月27日周四
  1. Hugging Face Blog86

    Google 发布 Gemma 2 开源大语言模型

    Google 发布了最新一代开源大语言模型 Gemma 2,包含 9B 和 27B 两种参数规模的基座与指令微调版本。该模型引入了滑动窗口注意力、Logit 软封顶、知识蒸馏和模型合并等四项主要技术进步,上下文长度为 8K tokens。Hugging Face 已同步提供 Transformers 集成、Inference Endpoints 部署支持以及基于 TRL 的微调示例代码。

    推荐理由:原文详细解析了Gemma 2在滑动窗口注意力、软封顶及知识蒸馏上的技术改进,并提供了基于Transformers的微调与部署指南。

5月14日周二
  1. Hugging Face Blog82

    谷歌发布开源视觉语言模型 PaliGemma

    谷歌推出开源视觉语言模型家族 PaliGemma,采用 SigLIP-So400m 作为图像编码器、Gemma-2B 作为文本解码器。该模型支持图像与文本输入并输出文本,提供预训练(PT)、混合任务微调(Mix)及特定基准微调(FT)三类检查点,涵盖 224x224、448x448、896x896 三种分辨率及多种精度格式。

    推荐理由:原文详细拆解了PaliGemma的架构组成与推理流程,并提供了基于Transformers的微调代码示例,适合开发者快速上手该开源视觉语言模型。

4月10日周三
4月9日周二
  1. Hugging Face Blog78

    Google 发布 CodeGemma 系列代码大模型

    Google 发布 CodeGemma 系列开源代码大模型,包含 2B 基础版、7B 基础版和 7B 指令微调版,均基于 Gemma 架构并额外使用 5000 亿 token 进行训练。

    推荐理由:原文给出了 CodeGemma 三个版本的训练数据、上下文长度及在 HumanEval 等基准上的表现,读者可据此评估其在代码补全和对话场景中的实际能力。

2月23日周五
2月21日周三
  1. Hugging Face Blog86

    Hugging Face 宣布支持 Google 开源大模型 Gemma

    Hugging Face 宣布全面支持 Google 发布的开源大模型 Gemma,提供 Transformers 集成及云端部署方案。Gemma 包含 2B 和 7B 参数版本,支持消费级 GPU 运行,并给出了基于 TRL 的单卡微调示例。

    推荐理由:原文详细说明了 Gemma 在 Hugging Face 生态中的集成方式、硬件适配性及微调流程,为开发者提供了从部署到训练的具体技术路径。

1月25日周四
  1. Hugging Face Blog42

    Hugging Face 与 Google Cloud 达成开放 AI 战略合作

    Hugging Face 宣布与 Google Cloud 建立战略合作,旨在通过开源模型和云技术赋能企业构建自有 AI。双方将在开放科学、开源工具及云端硬件领域深化协作,支持用户在 GKE 和 Vertex AI 中训练部署模型。该合作将整合 TPU、NVIDIA H100 GPU 等算力资源,并优化 Inference Endpoints 与 Spaces 的使用体验。

1月4日周四
  1. Hugging Face Blog63

    Hugging Face 发布高效非扩散文本到图像模型 aMUSEd

    Hugging Face 发布了名为 aMUSEd 的高效非扩散文本到图像模型,这是 Google MUSE 的开源复现版本。该模型采用掩码图像建模方法,参数量仅约 800M,支持零样本图像修复,并已在 diffusers 库中集成。用户可通过 LoRA 在 7GB 显存下完成微调,模型遵循 OpenRAIL 许可证允许商业使用。

    推荐理由:原文给出了基于掩码建模的非扩散架构细节及低显存微调方案,读者可据此评估其在推理效率与端侧部署上的实际潜力。

12月9日周五
  1. Hugging Face Blog33

    Hugging Face 详解 RLHF:从预训练到奖励模型再到强化学习微调

    Hugging Face 解析 RLHF 流程,涵盖预训练语言模型、基于人类偏好训练奖励模型及强化学习微调三个核心步骤。该方法通过标量奖励将人类反馈转化为损失函数以优化模型,成功应用于 ChatGPT 等系统。文中对比了 OpenAI InstructGPT、Anthropic 及 DeepMind Gopher 在参数规模与数据生成策略上的差异。

8月19日周五
3月23日周三
10月25日周一
  1. Hugging Face Blog35

    Hugging Face 社区周项目:使用 10 亿训练对与 TPU v3-8 训练 SOTA 句子嵌入模型

    Hugging Face 在“用 10 亿训练对训练最佳句子嵌入模型”项目中开发了 state-of-the-art 句子嵌入模型。该项目利用 7 个 TPU v3-8 和 JAX/Flax 框架,采用对比学习及 Multiple Negative Ranking Loss 进行训练。通过优化批次大小、引入 hard negatives 及使用缩放余弦相似度,显著提升了模型性能。