跳到正文

#图像生成

今日 0 条
9月30日周三
  1. Google Research38

    Google Research 提出 Diffusion Controller 框架统一 AI 图像生成控制

    Google Research 推出 Diffusion Controller 框架,将扩散模型去噪过程重构为连续控制问题以统一引导与微调。该框架通过轻量级“转向阻尼器”网络动态调整生成轨迹,在保持基础模型画质稳定的同时精准对齐用户意图。实验显示其完全解锁版本对基线模型取得 90% 胜率,有效解决黑盒模型难以精细控制的痛点。

7月23日周四
7月16日周四
7月1日周三
  1. Google DeepMind80

    Google DeepMind 发布 Nano Banana 2 Lite 与 Gemini Omni Flash 并开放开发者接入

    Google DeepMind 正式发布 Nano Banana 2 Lite 和 Gemini Omni Flash,并在 Google AI Studio、Gemini API 及 Gemini Enterprise Agent Platform 向开发者开放。

    推荐理由:官方同步开放两款新模型的开发者接口,明确了各自的延迟、成本及能力边界,为构建图文视频混合工作流提供了具体选型依据。

3月4日周三
2月27日周五
11月20日周四
8月19日周二
6月19日周四
5月21日周三
2月3日周六
1月15日周一
1月14日周日
  1. Hugging Face Blog65

    Hugging Face 发布教程:如何将 ComfyUI 工作流转为 Gradio 应用并在 Spaces 上免费运行

    Hugging Face 发布教程指导用户将复杂的 ComfyUI 工作流转换为简单的 Gradio 应用,并部署在 Hugging Face Spaces 的 ZeroGPU 架构上以实现免费的无服务器运行。

    推荐理由:原文提供了将 ComfyUI 工作流转换为 Gradio 应用并部署到 Hugging Face Spaces ZeroGPU 的完整步骤,读者可以据此实现免费服务器端推理。

1月4日周四
  1. Hugging Face Blog63

    Hugging Face 发布高效非扩散文本到图像模型 aMUSEd

    Hugging Face 发布了名为 aMUSEd 的高效非扩散文本到图像模型,这是 Google MUSE 的开源复现版本。该模型采用掩码图像建模方法,参数量仅约 800M,支持零样本图像修复,并已在 diffusers 库中集成。用户可通过 LoRA 在 7GB 显存下完成微调,模型遵循 OpenRAIL 许可证允许商业使用。

    推荐理由:原文给出了基于掩码建模的非扩散架构细节及低显存微调方案,读者可据此评估其在推理效率与端侧部署上的实际潜力。

11月9日周四
  1. Hugging Face Blog85

    Hugging Face 发布 Latent Consistency LoRAs 实现 SDXL 4 步快速生成

    Hugging Face 推出 Latent Consistency Models (LCM) LoRAs,允许在 Stable Diffusion XL 和 SD v1.5 等模型上通过仅 4-8 步推理实现高质量图像生成,显著加速过程(如 M1 Mac 上从约 60 秒降至 6 秒)。

    推荐理由:提供了将LCM LoRA应用于SDXL等模型的具体代码与基准测试,展示了如何在保持画质的前提下大幅降低推理步数并提升生成速度。

10月3日周二
10月2日周一
  1. Hugging Face Blog31

    使用 Inference API 部署 AI Comic Factory

    Hugging Face 教程展示如何通过 fork 并配置 AI Comic Factory,利用 Inference API 部署私有空间以消除排队等待。该应用基于 NextJS,需 PRO 账户访问 Llama-2 和 SDXL 1.0 模型,通过设置环境变量将语言与图像引擎指向 INFERENCE_API。目前该集成处于早期阶段,SDXL refiner 等部分功能尚未支持。

9月29日周五
9月13日周三
8月9日周三
  1. Hugging Face Blog26

    使用 BentoML 部署 Hugging Face DeepFloyd IF 模型实战

    BentoML 开源平台支持将 Hugging Face 上的 DeepFloyd IF 文本生成图像模型部署至生产环境。该流程涵盖定义模型、创建 Service、构建 Bento 及容器化部署,利用 T5-XXL-1.1 编码提示词并分三阶段在像素空间生成 1024x1024 px 图像。开发者可独立扩展各 Stage Runner 以优化 GPU 资源分配与推理性能。

8月1日周二