跳到正文

#图像生成

今日 0 条
9月30日周三
  1. Google Research42

    Google Research 提出 Diffusion Controller:统一并简化 AI 图像生成控制

    Google Research 提出 Diffusion Controller 框架,将扩散模型去噪过程重构为连续控制问题,通过轻量“转向阻尼”网络在不改动冻结基座模型的情况下调控生成轨迹。在 Stable Diffusion v1.4 上以 HPS-v2 评测,其完全解锁版本对基线模型取得 90% 胜率,并支持 SFT、RWL 与 PPO 三种微调方式。

9月8日周二
  1. OpenAI News62

    OpenAI 发布 ChatGPT Images 2.5

    OpenAI 发布 ChatGPT Images 2.5,可将想法、草图与参考照片转化为更个性化、更精致的图像,并更贴近用户原本的构想。

    推荐理由:官方给出 ChatGPT Images 2.5 的输入类型与输出定位,可据此判断图像生成能力的变化方向。

7月23日周四
  1. Hugging Face Blog60

    Diffusers 原生支持 Nunchaku 4-bit 扩散推理

    Hugging Face 在 Diffusers 中集成 Nunchaku Lite,可直接用 from_pretrained() 加载 Nunchaku 风格的 4-bit 量化 checkpoint,无需自定义 pipeline 或本地 CUDA 编译。

    推荐理由:Diffusers 原生接入 Nunchaku 4-bit 推理,给出了显存与延迟的实测对比,可据此判断消费级显卡跑扩散模型的实际收益。

7月1日周三
2月27日周五
11月20日周四
  1. Google DeepMind62

    Google 在 Gemini 应用中上线 AI 图像验证功能

    Google 在 Gemini 应用中上线图像验证功能,用户上传图片并提问即可借助 SynthID 数字水印判断该图是否由 Google AI 生成或编辑。SynthID 自 2023 年推出以来已为超过 200 亿件 AI 生成内容添加水印,Google 此前已用 SynthID Detector 与记者和媒体从业者测试。

    推荐理由:原文说明 Gemini 应用内可直接核验图片是否由 Google AI 生成,并给出后续扩展到视频音频与 C2PA 的路线。

  2. Google DeepMind80

    Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image)图像模型

    Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),这是基于 Gemini 3 Pro 构建的图像生成与编辑模型,已在 Google AI Studio 和 Vertex AI 以付费预览形式面向开发者推出。

    推荐理由:官方给出新图像模型的分辨率、文本渲染与搜索接地等能力细节,便于开发者判断是否替换现有图像生成方案。