最新精选
第 181–200 条 · 共 221 条- Hugging Face Blog精选AI 评分8282
Stable Diffusion 3 Medium(2B 参数)已上线 Hugging Face Hub 并支持通过 🧨 Diffusers 库使用。该模型采用多模态扩散 Transformer (MMDiT) 架构和 Rectified Flow Matching 训练目标,引入了新的 FlowMatchEulerDiscreteScheduler 调度器。
推荐理由:官方给出了 SD3 Medium 的架构细节、显存优化方案及微调脚本,开发者可据此评估其在不同硬件上的部署可行性。
Mistral AI 推出其首个专为代码生成设计的开放权重模型 Codestral。该模型参数量为 22B,支持 80 多种编程语言,拥有 32k 上下文窗口,并在 RepoBench 等长程代码生成评测中表现优于竞品。
推荐理由:官方详细披露了 Codestral 的架构参数、多语言支持及基准测试数据,并明确了非生产许可与商业授权路径,为开发者评估其实际编码能力提供了完整依据。
- Hugging Face Blog精选AI 评分6868
TII 发布 Falcon 2 系列新模型,包含 11B 参数的基础大语言模型(LLM)和支持图像理解的视觉语言模型(VLM)。
推荐理由:原文给出了11B参数模型的训练数据规模、架构细节及在英语和多语言基准上的具体评测分数,读者可据此评估其性能与开源可用性。
- Hugging Face Blog精选AI 评分8282
谷歌推出开源视觉语言模型家族 PaliGemma,采用 SigLIP-So400m 作为图像编码器、Gemma-2B 作为文本解码器。该模型支持图像与文本输入并输出文本,提供预训练(PT)、混合任务微调(Mix)及特定基准微调(FT)三类检查点,涵盖 224x224、448x448、896x896 三种分辨率及多种精度格式。
推荐理由:原文详细拆解了PaliGemma的架构组成与推理流程,并提供了基于Transformers的微调代码示例,适合开发者快速上手该开源视觉语言模型。
OpenAI 正式发布 GPT-4o(GPT-4 Omni),这是一款能够同时处理文本、音频和图像输入并生成相应输出的新旗舰模型。该模型旨在实现更自然的人机交互体验,支持实时语音对话及高级视觉分析功能。
推荐理由:OpenAI 官方宣布 GPT-4o 发布,强调其作为旗舰模型在音频、视觉和文本处理上的原生多模态能力。
OpenAI 官方宣布发布新模型。具体型号及能力细节未在标题中明确展示。
推荐理由:OpenAI 官方宣布新模型发布,提供了最权威的一手信息源。
OpenAI 于 2024-05-13 通过官方新闻源发布新模型,具体型号及能力细节未在标题中披露。
- Hugging Face Blog精选AI 评分6161
Hugging Face 发布 StarCoder2-15B-Instruct-v0.1,这是首个采用完全宽松且透明管道训练的自对齐代码 LLM。该模型利用 StarCoder2-15B 自身生成指令和响应进行微调,在 HumanEval 上取得 72.6 分,超越了 CodeLlama-70B-Instruct。
推荐理由:展示了完全自对齐的代码模型训练流程,提供了无需蒸馏专有模型即可达到高性能的开源方案。
- Hugging Face Blog精选AI 评分9292
Meta 正式发布 Llama 3 系列开源大语言模型,包含 8B 和 70B 两种参数规模,均提供基础版和指令微调版。该模型采用新 tokenizer 将词汇表扩展至 128,256,并在超过 15 万亿 tokens 的数据上进行了预训练。
推荐理由:原文详细列出了 Llama 3 的模型规格、训练数据量及在 Hugging Face 生态中的集成方式,为开发者提供了从本地部署到云端推理的具体技术路径。
Mistral AI 发布最新开源模型 Mixtral 8x22B,采用稀疏混合专家(SMoE)架构,总参数 141B 但仅激活 39B。该模型支持英法意德西五种语言,具备函数调用能力,拥有 64K tokens 上下文窗口,并以最宽松的 Apache 2.0 许可证发布。在 MMLU、HumanEval 等基准测试中,其性能超越其他开源权重模型,且推理速度优于任何稠密 70B 模型。
推荐理由:官方详细披露了 Mixtral 8x22B 的稀疏激活参数、多语言基准表现及 Apache 2.0 许可,为评估其成本效率与开源价值提供了一手数据。
- Hugging Face Blog精选AI 评分7070
Hugging Face 正式发布 Idefics2,这是一个拥有8B参数的通用多模态模型,支持文本与图像混合输入及生成。该模型采用 Apache 2.0 许可证开源,显著增强了 OCR 能力,并在 Visual Question Answering 等基准测试中表现优于同尺寸模型,甚至可与 LLava-Next-34B 等更大模型竞争。
推荐理由:Idefics2 以8B参数和Apache 2.0协议开源,在视觉问答基准上表现优异并简化了微调流程,为社区提供了强大的多模态基础。
- Hugging Face Blog精选AI 评分7878
Google 发布 CodeGemma 系列开源代码大模型,包含 2B 基础版、7B 基础版和 7B 指令微调版,均基于 Gemma 架构并额外使用 5000 亿 token 进行训练。
推荐理由:原文给出了 CodeGemma 三个版本的训练数据、上下文长度及在 HumanEval 等基准上的表现,读者可据此评估其在代码补全和对话场景中的实际能力。
- Hugging Face Blog精选AI 评分8282
BigCode 团队发布新一代开源代码大模型 StarCoder2 及其训练数据集 The Stack v2,并开放所有模型权重、数据处理和训练代码。StarCoder2 包含 3B、7B 和 15B 三种参数规模,其中旗舰版 StarCoder2-15B 基于 600 多种编程语言和超过 4 万亿 token 训练,性能在同类尺寸中领先并可媲美 33B+ 模型。
推荐理由:原文公开了 StarCoder2 系列模型的参数规模、训练数据细节及代码权重,为开发者提供了透明可复现的开源代码大模型选择。
Mistral AI 发布最新旗舰语言模型 Mistral Large,该模型具备强大的多语言推理和代码生成能力,通过 API 提供时排名全球第二(仅次于 GPT-4)。
推荐理由:Mistral Large 在多项基准测试中表现优异,并宣布与 Microsoft Azure 达成合作,为开发者提供了新的前沿模型选择。
- Hugging Face Blog精选AI 评分8686
Hugging Face 宣布全面支持 Google 发布的开源大模型 Gemma,提供 Transformers 集成及云端部署方案。Gemma 包含 2B 和 7B 参数版本,支持消费级 GPU 运行,并给出了基于 TRL 的单卡微调示例。
推荐理由:原文详细说明了 Gemma 在 Hugging Face 生态中的集成方式、硬件适配性及微调流程,为开发者提供了从部署到训练的具体技术路径。
OpenAI 正式推出名为 Sora 的文本到视频生成模型,能够根据提示词生成长达一分钟的高保真视频。该模型展示了在理解物理世界运动规律方面的显著进展,支持复杂场景和多角色互动。
推荐理由:官方直接发布了新模型的入口和核心能力说明,读者可据此评估其在视频生成领域的实际表现。
- Hugging Face Blog精选AI 评分6363
Hugging Face 发布了名为 aMUSEd 的高效非扩散文本到图像模型,这是 Google MUSE 的开源复现版本。该模型采用掩码图像建模方法,参数量仅约 800M,支持零样本图像修复,并已在 diffusers 库中集成。用户可通过 LoRA 在 7GB 显存下完成微调,模型遵循 OpenRAIL 许可证允许商业使用。
推荐理由:原文给出了基于掩码建模的非扩散架构细节及低显存微调方案,读者可据此评估其在推理效率与端侧部署上的实际潜力。
Mistral AI 发布高质量稀疏混合专家模型(SMoE)Mixtral 8x7B,采用 Apache 2.0 许可开放权重。该模型在大多数基准测试中超越 Llama 2 70B,推理速度提升 6 倍,并在标准基准上匹配或超过 GPT3.5。
推荐理由:官方详细披露了 Mixtral 8x7B 的稀疏专家架构、性能基准及多语言能力,为开发者评估其成本效益和部署可行性提供了核心依据。
- Hugging Face Blog精选AI 评分8787
Hugging Face 正式支持 Mistral 发布的 Mixtral 8x7b 模型,该模型采用 Mixture of Experts (MoE) 架构,在多个基准测试中超越 GPT-3.5 并创下开源模型新纪录。
推荐理由:原文详细说明了 Mixtral 在 Hugging Face 生态中的集成方式、推理部署选项及微调示例,为开发者提供了从模型获取到生产环境落地的完整技术路径。
OpenAI 在 DevDay 上宣布推出 GPT-4 Turbo 模型以及一系列面向开发者的新产品。此次更新重点包括支持更长上下文窗口的 GPT-4 Turbo,旨在提升模型处理复杂任务的能力并优化开发体验。
推荐理由:官方在 DevDay 集中发布了新模型与开发者工具,明确了当前 API 能力的升级方向。