跳到正文

#模型发布

今日 0 条
4月17日周三
  1. Mistral AI82

    Mistral AI 发布开源大模型 Mixtral 8x22B

    Mistral AI 发布最新开源模型 Mixtral 8x22B,采用稀疏混合专家(SMoE)架构,总参数 141B 但仅激活 39B。该模型支持英法意德西五种语言,具备函数调用能力,拥有 64K tokens 上下文窗口,并以最宽松的 Apache 2.0 许可证发布。在 MMLU、HumanEval 等基准测试中,其性能超越其他开源权重模型,且推理速度优于任何稠密 70B 模型。

    推荐理由:官方详细披露了 Mixtral 8x22B 的稀疏激活参数、多语言基准表现及 Apache 2.0 许可,为评估其成本效率与开源价值提供了一手数据。

4月15日周一
  1. Hugging Face Blog70

    Hugging Face 发布 Idefics2:8B 参数开源视觉语言模型

    Hugging Face 正式发布 Idefics2,这是一个拥有8B参数的通用多模态模型,支持文本与图像混合输入及生成。该模型采用 Apache 2.0 许可证开源,显著增强了 OCR 能力,并在 Visual Question Answering 等基准测试中表现优于同尺寸模型,甚至可与 LLava-Next-34B 等更大模型竞争。

    推荐理由:Idefics2 以8B参数和Apache 2.0协议开源,在视觉问答基准上表现优异并简化了微调流程,为社区提供了强大的多模态基础。

4月9日周二
  1. Hugging Face Blog78

    Google 发布 CodeGemma 系列代码大模型

    Google 发布 CodeGemma 系列开源代码大模型,包含 2B 基础版、7B 基础版和 7B 指令微调版,均基于 Gemma 架构并额外使用 5000 亿 token 进行训练。

    推荐理由:原文给出了 CodeGemma 三个版本的训练数据、上下文长度及在 HumanEval 等基准上的表现,读者可据此评估其在代码补全和对话场景中的实际能力。

2月28日周三
  1. Hugging Face Blog82

    BigCode 发布 StarCoder2 系列开源代码大模型及 The Stack v2 数据集

    BigCode 团队发布新一代开源代码大模型 StarCoder2 及其训练数据集 The Stack v2,并开放所有模型权重、数据处理和训练代码。StarCoder2 包含 3B、7B 和 15B 三种参数规模,其中旗舰版 StarCoder2-15B 基于 600 多种编程语言和超过 4 万亿 token 训练,性能在同类尺寸中领先并可媲美 33B+ 模型。

    推荐理由:原文公开了 StarCoder2 系列模型的参数规模、训练数据细节及代码权重,为开发者提供了透明可复现的开源代码大模型选择。

2月26日周一
2月21日周三
  1. Hugging Face Blog86

    Hugging Face 宣布支持 Google 开源大模型 Gemma

    Hugging Face 宣布全面支持 Google 发布的开源大模型 Gemma,提供 Transformers 集成及云端部署方案。Gemma 包含 2B 和 7B 参数版本,支持消费级 GPU 运行,并给出了基于 TRL 的单卡微调示例。

    推荐理由:原文详细说明了 Gemma 在 Hugging Face 生态中的集成方式、硬件适配性及微调流程,为开发者提供了从部署到训练的具体技术路径。

2月15日周四
  1. OpenAI News92

    OpenAI 发布 Sora 文本到视频生成模型

    OpenAI 正式推出名为 Sora 的文本到视频生成模型,能够根据提示词生成长达一分钟的高保真视频。该模型展示了在理解物理世界运动规律方面的显著进展,支持复杂场景和多角色互动。

    推荐理由:官方直接发布了新模型的入口和核心能力说明,读者可据此评估其在视频生成领域的实际表现。

1月4日周四
  1. Hugging Face Blog63

    Hugging Face 发布高效非扩散文本到图像模型 aMUSEd

    Hugging Face 发布了名为 aMUSEd 的高效非扩散文本到图像模型,这是 Google MUSE 的开源复现版本。该模型采用掩码图像建模方法,参数量仅约 800M,支持零样本图像修复,并已在 diffusers 库中集成。用户可通过 LoRA 在 7GB 显存下完成微调,模型遵循 OpenRAIL 许可证允许商业使用。

    推荐理由:原文给出了基于掩码建模的非扩散架构细节及低显存微调方案,读者可据此评估其在推理效率与端侧部署上的实际潜力。

12月11日周一
  1. Mistral AI89

    Mistral AI 发布开源混合专家模型 Mixtral 8x7B

    Mistral AI 发布高质量稀疏混合专家模型(SMoE)Mixtral 8x7B,采用 Apache 2.0 许可开放权重。该模型在大多数基准测试中超越 Llama 2 70B,推理速度提升 6 倍,并在标准基准上匹配或超过 GPT3.5。

    推荐理由:官方详细披露了 Mixtral 8x7B 的稀疏专家架构、性能基准及多语言能力,为开发者评估其成本效益和部署可行性提供了核心依据。

  2. Hugging Face Blog87

    Hugging Face 宣布支持 Mistral 发布的 SOTA 混合专家模型 Mixtral

    Hugging Face 正式支持 Mistral 发布的 Mixtral 8x7b 模型,该模型采用 Mixture of Experts (MoE) 架构,在多个基准测试中超越 GPT-3.5 并创下开源模型新纪录。

    推荐理由:原文详细说明了 Mixtral 在 Hugging Face 生态中的集成方式、推理部署选项及微调示例,为开发者提供了从模型获取到生产环境落地的完整技术路径。

12月6日周三
  1. Hugging Face Blog42

    Intel Labs 与 Hugging Face 联合推出 SetFitABSA:少样本基于方面的情感分析框架

    Intel Labs 与 Hugging Face 联合发布 SetFitABSA,一种用于少样本训练领域特定 ABSA 模型的框架。该技术在少样本场景下表现优异,甚至超越 Llama2 和 T5 等生成式模型。SetFitABSA 无需手工提示词且训练快速,仅需少量标注样本即可通过生成丰富嵌入向量实现高效情感分析。

11月6日周一
  1. OpenAI News82

    OpenAI 在 DevDay 发布 GPT-4 Turbo 及开发者产品更新

    OpenAI 在 DevDay 上宣布推出 GPT-4 Turbo 模型以及一系列面向开发者的新产品。此次更新重点包括支持更长上下文窗口的 GPT-4 Turbo,旨在提升模型处理复杂任务的能力并优化开发体验。

    推荐理由:官方在 DevDay 集中发布了新模型与开发者工具,明确了当前 API 能力的升级方向。

9月27日周三
  1. Mistral AI86

    Mistral AI 发布 Mistral 7B 开源模型

    Mistral AI 发布 Mistral 7B,这是一个拥有 7.3B 参数的语言模型,采用 Apache 2.0 许可证完全开源。该模型在所有基准测试中均优于 Llama 2 13B,在许多基准上超过 Llama 1 34B,并使用分组查询注意力(GQA)和滑动窗口注意力(SWA)以加速推理和处理长序列。

    推荐理由:原文给出了 Mistral 7B 在多项基准上超越 Llama 2 13B 的实测数据及 Apache 2.0 开源许可,读者可据此评估小参数模型的性价比与部署可行性。

  2. Mistral AI82

    Mistral AI 发布 Mistral 7B 并倡导开放模型

    Mistral AI 发布其首个 70 亿参数模型 Mistral 7B,该模型在所有标准英语和代码基准测试中超越了目前可用的所有高达 130 亿参数的开源模型。公司以 Apache 2.0 许可证开源该模型,旨在通过社区驱动的开放权重方法构建对 AI 寡头的可信替代方案。Mistral AI 承诺将持续发布缩小与黑盒模型性能差距的新模型,并同步推进商业专有模型及托管解决方案的开发。

    推荐理由:Mistral AI 阐述开放权重模型对抗闭源垄断的理念,并发布首个超越同量级开源模型的 Mistral 7B。

9月13日周三
9月6日周三
  1. Hugging Face Blog82

    Hugging Face 上线 TII Falcon 180B 开源大模型

    TII 发布的 Falcon 180B 正式登陆 Hugging Face Hub,提供 base 和 chat 版本。该模型拥有 1800 亿参数,基于 RefinedWeb 数据集在 3.5 万亿 tokens 上完成预训练,是当时最大的公开可用语言模型。其性能在多项基准测试中超越 Llama 2 70B,接近 PaLM-2 Large,但商用许可对托管使用有严格限制。

    推荐理由:原文给出了 Falcon 180B 的参数量、训练数据规模及硬件需求,读者可据此评估其在开源大模型中的性能定位与部署门槛。

8月25日周五
  1. Hugging Face Blog86

    Hugging Face 发布 Code Llama 集成支持

    Hugging Face 宣布在生态系统中集成 Meta 发布的 Code Llama 模型系列,提供 transformers 4.33+ 支持、Text Generation Inference 部署及 VS Code 扩展。

    推荐理由:原文给出了 Code Llama 在 Hugging Face 生态中的集成方式、不同参数规模的能力差异以及具体的部署与微调建议,读者可以据此判断如何将其接入现有开发工作流。

8月22日周二
  1. Hugging Face Blog70

    Hugging Face 发布开源视觉语言模型 IDEFICS

    Hugging Face 推出开源视觉语言模型 IDEFICS,作为 DeepMind Flamingo 的公开复现版本。该模型提供 9B 和 80B 参数两种规模及指令微调变体,支持图文交错输入与文本生成。训练数据包含新创建的 115B token 数据集 OBELICS,模型权重在 Hugging Face Hub 上线并集成至 transformers 库。

    推荐理由:原文公开了基于 Flamingo 架构的开源复现细节及 OBELICS 数据集,为社区提供了可验证的多模态大模型训练基准。

7月18日周二
6月16日周五
6月5日周一
  1. Hugging Face Blog84

    Falcon 系列大语言模型正式登陆 Hugging Face 生态

    阿布扎比技术创新研究所(TII)发布的 Falcon 系列开源大语言模型已全面集成至 Hugging Face 生态系统。该系列包含 Falcon-7B 和 Falcon-40B 两个基础版本及对应的指令微调版,均采用 Apache 2.0 许可证并支持商业使用。

    推荐理由:原文详细展示了 Falcon 模型在 Hugging Face 生态中的推理、量化及微调全流程,为开发者提供了可直接复用的工程实践指南。

5月31日周三
5月15日周一
5月4日周四
3月14日周二
  1. OpenAI News92

    OpenAI 发布 GPT-4 多模态大模型

    OpenAI 发布 GPT-4,这是其深度学习规模化工作的最新里程碑。GPT-4 是一个大型多模态模型,接受图像和文本输入并输出文本。尽管在许多现实场景中能力仍不及人类,但它在各类专业和学术基准测试中展现出人类水平的性能。

    推荐理由:原文确认 GPT-4 为支持图文输入的多模态大模型,并在专业与学术基准上达到人类水平表现。

3月6日周一
11月30日周三
  1. OpenAI News99

    OpenAI 正式发布 ChatGPT

    OpenAI 正式推出 ChatGPT,这是一个基于对话交互的人工智能模型。用户可通过 OpenAI 官网直接体验其对话能力。

    推荐理由:OpenAI 官方宣布 ChatGPT 上线,读者可据此确认该对话模型的初始发布节点及官方入口。

10月5日周三
  1. Hugging Face Blog38

    rinna 发布 Japanese Stable Diffusion:基于 Stable Diffusion 微调的日语文生图模型

    rinna Co., Ltd. 推出 Japanese Stable Diffusion,通过微调 Stable Diffusion 实现原生日语提示词生成。该模型利用约 1 亿张带日语字幕图像训练,采用两阶段 PITI 方法优化文本编码器,能准确理解日本文化、俚语及拟声词。模型已上线 Hugging Face 和 GitHub,代码基于 🧨 Diffusers。

9月21日周三
  1. OpenAI News82

    OpenAI 开源语音识别模型 Whisper

    OpenAI 训练并开源了名为 Whisper 的神经网络模型。该模型在英语语音识别任务中展现出接近人类水平的鲁棒性和准确性。

    推荐理由:原文宣布开源 Whisper 模型,指出其在英语语音识别上接近人类水平的鲁棒性和准确性。

7月12日周二
3月15日周二
2月2日周三
1月27日周四
  1. OpenAI News78

    OpenAI 发布 InstructGPT 并设为 API 默认模型

    OpenAI 推出 InstructGPT 模型,该模型在遵循用户意图、真实性和低毒性方面优于 GPT-3,现已作为默认语言模型部署于其 API。InstructGPT 采用人类反馈强化学习技术训练,旨在更好地对齐用户指令。

    推荐理由:OpenAI 官方宣布 InstructGPT 成为 API 默认模型,展示了通过人类反馈提升指令遵循能力与降低毒性的具体成果。

12月15日周三
  1. Hugging Face Blog53

    Hugging Face Transformers 集成 Perceiver IO 全模态模型

    Hugging Face 宣布将 Perceiver IO 加入 Transformers 库,这是首个支持文本、图像、音频、视频和点云等多种模态及其组合的 Transformer 基神经网络。该模型通过在潜在变量上执行自注意力机制,解决了传统 Transformer 在高维数据上的计算和内存扩展性限制。文中展示了其在光学流预测、图像分类及多模态自动编码等任务中的具体实现代码与性能表现。

10月29日周五
10月26日周二
1月5日周二
  1. OpenAI News80

    OpenAI 发布 DALL-E 文本生成图像模型

    OpenAI 发布了名为 DALL-E 的新 AI 系统,能够根据自然语言描述创建逼真的图像和绘画。该模型可以处理包含多个对象、属性及场景的复杂提示词,实现从文本到图像的精准转换。

    推荐理由:官方确认了 DALL-E 这一新文本到图像生成模型的发布,展示了其根据自然语言描述合成复杂图像的能力。

  2. OpenAI News70

    OpenAI 发布 CLIP:连接文本与图像的神经网络

    OpenAI 推出名为 CLIP 的神经网络,该模型通过自然语言监督高效学习视觉概念。CLIP 可直接应用于任何视觉分类基准,只需提供待识别类别的名称即可实现类似 GPT-2 和 GPT-3 的零样本能力。

    推荐理由:原文介绍了CLIP通过自然语言监督学习视觉概念,并具备类似GPT的零样本分类能力。

6月17日周三