跳到正文

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

221条精选相关主题产品更新论文研究开源生态

最新精选

第 201–220 条 · 共 221 条
9月27日周三
  1. Mistral AI86

    Mistral AI 发布 Mistral 7B 开源模型

    Mistral AI 发布 Mistral 7B,这是一个拥有 7.3B 参数的语言模型,采用 Apache 2.0 许可证完全开源。该模型在所有基准测试中均优于 Llama 2 13B,在许多基准上超过 Llama 1 34B,并使用分组查询注意力(GQA)和滑动窗口注意力(SWA)以加速推理和处理长序列。

    推荐理由:原文给出了 Mistral 7B 在多项基准上超越 Llama 2 13B 的实测数据及 Apache 2.0 开源许可,读者可据此评估小参数模型的性价比与部署可行性。

  2. Mistral AI82

    Mistral AI 发布 Mistral 7B 并倡导开放模型

    Mistral AI 发布其首个 70 亿参数模型 Mistral 7B,该模型在所有标准英语和代码基准测试中超越了目前可用的所有高达 130 亿参数的开源模型。公司以 Apache 2.0 许可证开源该模型,旨在通过社区驱动的开放权重方法构建对 AI 寡头的可信替代方案。Mistral AI 承诺将持续发布缩小与黑盒模型性能差距的新模型,并同步推进商业专有模型及托管解决方案的开发。

    推荐理由:Mistral AI 阐述开放权重模型对抗闭源垄断的理念,并发布首个超越同量级开源模型的 Mistral 7B。

9月6日周三
  1. Hugging Face Blog82

    Hugging Face 上线 TII Falcon 180B 开源大模型

    TII 发布的 Falcon 180B 正式登陆 Hugging Face Hub,提供 base 和 chat 版本。该模型拥有 1800 亿参数,基于 RefinedWeb 数据集在 3.5 万亿 tokens 上完成预训练,是当时最大的公开可用语言模型。其性能在多项基准测试中超越 Llama 2 70B,接近 PaLM-2 Large,但商用许可对托管使用有严格限制。

    推荐理由:原文给出了 Falcon 180B 的参数量、训练数据规模及硬件需求,读者可据此评估其在开源大模型中的性能定位与部署门槛。

8月25日周五
  1. Hugging Face Blog86

    Hugging Face 发布 Code Llama 集成支持

    Hugging Face 宣布在生态系统中集成 Meta 发布的 Code Llama 模型系列,提供 transformers 4.33+ 支持、Text Generation Inference 部署及 VS Code 扩展。

    推荐理由:原文给出了 Code Llama 在 Hugging Face 生态中的集成方式、不同参数规模的能力差异以及具体的部署与微调建议,读者可以据此判断如何将其接入现有开发工作流。

8月22日周二
  1. Hugging Face Blog70

    Hugging Face 发布开源视觉语言模型 IDEFICS

    Hugging Face 推出开源视觉语言模型 IDEFICS,作为 DeepMind Flamingo 的公开复现版本。该模型提供 9B 和 80B 参数两种规模及指令微调变体,支持图文交错输入与文本生成。训练数据包含新创建的 115B token 数据集 OBELICS,模型权重在 Hugging Face Hub 上线并集成至 transformers 库。

    推荐理由:原文公开了基于 Flamingo 架构的开源复现细节及 OBELICS 数据集,为社区提供了可验证的多模态大模型训练基准。

7月18日周二
6月5日周一
  1. Hugging Face Blog84

    Falcon 系列大语言模型正式登陆 Hugging Face 生态

    阿布扎比技术创新研究所(TII)发布的 Falcon 系列开源大语言模型已全面集成至 Hugging Face 生态系统。该系列包含 Falcon-7B 和 Falcon-40B 两个基础版本及对应的指令微调版,均采用 Apache 2.0 许可证并支持商业使用。

    推荐理由:原文详细展示了 Falcon 模型在 Hugging Face 生态中的推理、量化及微调全流程,为开发者提供了可直接复用的工程实践指南。

5月15日周一
5月4日周四
3月14日周二
  1. OpenAI News92

    OpenAI 发布 GPT-4 多模态大模型

    OpenAI 发布 GPT-4,这是其深度学习规模化工作的最新里程碑。GPT-4 是一个大型多模态模型,接受图像和文本输入并输出文本。尽管在许多现实场景中能力仍不及人类,但它在各类专业和学术基准测试中展现出人类水平的性能。

    推荐理由:原文确认 GPT-4 为支持图文输入的多模态大模型,并在专业与学术基准上达到人类水平表现。

11月30日周三
  1. OpenAI News99

    OpenAI 正式发布 ChatGPT

    OpenAI 正式推出 ChatGPT,这是一个基于对话交互的人工智能模型。用户可通过 OpenAI 官网直接体验其对话能力。

    推荐理由:OpenAI 官方宣布 ChatGPT 上线,读者可据此确认该对话模型的初始发布节点及官方入口。

9月21日周三
  1. OpenAI News82

    OpenAI 开源语音识别模型 Whisper

    OpenAI 训练并开源了名为 Whisper 的神经网络模型。该模型在英语语音识别任务中展现出接近人类水平的鲁棒性和准确性。

    推荐理由:原文宣布开源 Whisper 模型,指出其在英语语音识别上接近人类水平的鲁棒性和准确性。

7月12日周二
1月27日周四
  1. OpenAI News78

    OpenAI 发布 InstructGPT 并设为 API 默认模型

    OpenAI 推出 InstructGPT 模型,该模型在遵循用户意图、真实性和低毒性方面优于 GPT-3,现已作为默认语言模型部署于其 API。InstructGPT 采用人类反馈强化学习技术训练,旨在更好地对齐用户指令。

    推荐理由:OpenAI 官方宣布 InstructGPT 成为 API 默认模型,展示了通过人类反馈提升指令遵循能力与降低毒性的具体成果。

1月5日周二
  1. OpenAI News80

    OpenAI 发布 DALL-E 文本生成图像模型

    OpenAI 发布了名为 DALL-E 的新 AI 系统,能够根据自然语言描述创建逼真的图像和绘画。该模型可以处理包含多个对象、属性及场景的复杂提示词,实现从文本到图像的精准转换。

    推荐理由:官方确认了 DALL-E 这一新文本到图像生成模型的发布,展示了其根据自然语言描述合成复杂图像的能力。

  2. OpenAI News70

    OpenAI 发布 CLIP:连接文本与图像的神经网络

    OpenAI 推出名为 CLIP 的神经网络,该模型通过自然语言监督高效学习视觉概念。CLIP 可直接应用于任何视觉分类基准,只需提供待识别类别的名称即可实现类似 GPT-2 和 GPT-3 的零样本能力。

    推荐理由:原文介绍了CLIP通过自然语言监督学习视觉概念,并具备类似GPT的零样本分类能力。

11月5日周二
  1. OpenAI News72

    OpenAI 发布新模型

    OpenAI 于 2019 年 11 月 5 日通过官方博客宣布发布一款新模型。该消息源自 OpenAI News RSS 订阅源,标志着该公司在人工智能领域的又一次技术更新。

    推荐理由:OpenAI 官方发布新模型,提供了关于其能力演进的第一手信息,有助于理解前沿模型的最新进展。

8月20日周二
  1. OpenAI News80

    OpenAI 发布 GPT-2 774M 参数模型及开源法律协议

    OpenAI 在继小模型和中等模型的分阶段发布后,正式推出拥有 774 million 参数的 GPT-2 语言模型。同时发布了旨在促进组织间模型共享合作的开源法律协议,并公开了关于协调 AI 研究社区出版规范的技术报告。

    推荐理由:原文披露了GPT-2大参数模型的发布节奏及配套的开源法律协议,读者可据此了解其分阶段公开策略与行业协作规范。

2月14日周四
  1. OpenAI News92

    OpenAI 发布大规模无监督语言模型及其影响

    OpenAI 训练了一个大规模无监督语言模型,该模型能生成连贯段落并在多项语言建模基准上达到 SOTA 性能。它无需任务特定训练即可执行基础的阅读理解、机器翻译、问答和摘要等任务。

    推荐理由:原文介绍了无需任务特定训练即可在多项基准上取得SOTA的大规模无监督语言模型,展示了其在文本生成及基础NLP任务上的通用能力。