Google Research·· 2026-06-27AI 评分45
Google 在 Pixel 上通过冻结 Multi-Token Prediction 加速 Gemini Nano v3
Accelerating Gemini Nano models on Pixel with frozen Multi-Token Prediction
AI 导读
Google 推出新架构,将 Multi-Token Prediction (MTP) 头集成到冻结的 Gemini Nano v3 模型中,已在 Pixel 9/10 系列上线。该方案利用零拷贝架构复用主模型 KV cache,节省 130MB 内存,使文本生成速度提升超 50% 且保持输出完全一致。
来源:Google Research · research.google