Hugging Face Blog·· 2025-04-11AI 评分28
Visual Salamandra 发布:基于 7B 参数模型的多模态理解能力扩展
Visual Salamandra: Pushing the Boundaries of Multimodal Understanding
AI 导读
Language Technologies Lab 发布 Visual Salamandra,将 Salamandra LLM 扩展至图像与视频多模态任务。该模型基于 70 亿参数基础架构,集成 Google SigLIP 编码器与 MLP 投影器,支持 VQA、OCR 及数学推理等应用。其训练涵盖 610 万指令微调实例,重点强化欧洲语言多样性与多模态对齐能力。
来源:Hugging Face Blog · huggingface.co