Diffusion Controller 如何统一并简化 AI 图像生成
Google Research 提出 Diffusion Controller 框架,将图像生成的去噪过程重构为连续控制问题。该框架通过轻量级附加网络调节生成轨迹,并在 Stable Diffusion v1.4 上评估 SFT、RWL 和 PPO 训练方式;完全解锁版本相对基线模型取得了 90% 的胜率。
Google Research 提出 Diffusion Controller 框架,将图像生成的去噪过程重构为连续控制问题。该框架通过轻量级附加网络调节生成轨迹,并在 Stable Diffusion v1.4 上评估 SFT、RWL 和 PPO 训练方式;完全解锁版本相对基线模型取得了 90% 的胜率。
AWS 介绍如何在 Amazon SageMaker AI 上部署两个 vLLM-Omni 端点,将 FLUX.2-klein-4B 生成的图像传给 Wan2.1-VACE-1.3B,生成短视频。图像端点采用实时推理,视频端点采用异步推理,并通过 Amazon S3 传递 multipart 请求和获取 MP4 结果。文章还提供命令行与 Streamlit 示例、部署命令及清理脚本。
推荐理由:文章把图像实时推理与视频异步推理串成可复用流程,并给出部署脚本、请求格式和清理步骤,便于理解两种响应模式的取舍。
OpenAI 发布 ChatGPT Images 2.5,可将想法、草图和参考照片转化为更个性化、更精致且更贴合原意的图像。
作者用 TRL 和 OpenEnv 复现水彩画代码训练方法,通过 GRPO 训练 Qwen3.5-35B-A3B,让模型编写调用 p5.brush 的 JavaScript,并向个人审美偏好靠拢。
推荐理由:将通用审美评分与人工筛选参考图的对比奖励分开实验,展示了减少劣质输出与贴近个人画风是两种不同的训练目标。
Hugging Face 已在 Diffusers 中原生支持 Nunchaku Lite,Nunchaku checkpoint 可通过 from_pretrained() 加载,无需本地 CUDA 编译。
推荐理由:文章给出原生加载、量化工具链和硬件支持范围,并用基准数据呈现 Nunchaku Lite 的显存与速度变化。
Google Research 在 ICLR 2026 论文中指出,扩散模型的创造力来自神经网络训练对 score function 产生的 score smoothing,而非随机现象。研究表明,正则化会让模型在训练数据点之间生成新的合理样本,并在高维场景中帮助恢复数据流形。Google Research 同时发布了用于生成论文图表的数值实验代码。
PRX 团队介绍了其图像生成模型的预训练数据流程:混合公共与内部数据集,使用 VLM 为图像生成长描述,并以 Lance 构建和探索数据、以 Mosaic Data Shards(MDS)供训练流式读取。团队在数亿级数据上采用 JPEG quality 92、分辨率与宽高比分桶、基于 caption 的过滤和感知哈希去重,并选择 Qwen3-VL-8B 作为 captioner。
推荐理由:文章把 PRX 的大规模图像训练数据流程拆成可复用环节,覆盖数据探索、VLM 重标注、格式转换、过滤去重及工程取舍。
Google DeepMind 发布 Nano Banana 2 Lite 图像模型,并面向开发者开放 Gemini Omni Flash 视频生成与对话式编辑模型。
推荐理由:文章同时给出图像与视频模型的定位、价格和限制,便于开发者比较生成速度、成本与可用范围。
Google Research 宣布,Google Photos 已在 Auto frame 中提供自动重构照片视角的功能。该功能先估计 3D 点图和相机参数,再用生成式 latent diffusion model 补全新视角下原本未拍到的区域,并自动调整人像构图、缓解广角自拍的透视畸变。符合条件的含人物照片可在 Auto frame 候选中获取重构后的第二个版本。
推荐理由:Google Photos 的 Auto frame 将 3D 场景重建与生成式修补结合,用于自动调整人像视角,呈现生成式编辑从裁剪到视角重构的变化。
Mistral AI 为 Le Chat 发布 Deep Research(Preview)、语音模式、Projects、多语言推理和高级图像编辑等功能。Deep Research agent 可规划问题、搜索资料并生成带引用的结构化报告,语音模式由 Voxtral 驱动,Think mode 由 Magistral 驱动。
推荐理由:Le Chat此次更新覆盖研究、语音、项目管理和图像编辑,展示了多种交互能力如何集中到同一助手中。