跳到正文

#图像生成

今日 0 条
9月30日周三
9月29日周二
  1. AWS Machine Learning Blog62

    教程:AWS 在 SageMaker AI 上用 vLLM-Omni 生成图像并将其动画化为视频

    AWS 介绍如何在 Amazon SageMaker AI 上部署两个 vLLM-Omni 端点,将 FLUX.2-klein-4B 生成的图像传给 Wan2.1-VACE-1.3B,生成短视频。图像端点采用实时推理,视频端点采用异步推理,并通过 Amazon S3 传递 multipart 请求和获取 MP4 结果。文章还提供命令行与 Streamlit 示例、部署命令及清理脚本。

    推荐理由:文章把图像实时推理与视频异步推理串成可复用流程,并给出部署脚本、请求格式和清理步骤,便于理解两种响应模式的取舍。

9月8日周二
9月3日周四
7月23日周四
7月16日周四
  1. Google Research54

    Google Research 论文解释扩散模型的创造力来自 score smoothing

    Google Research 在 ICLR 2026 论文中指出,扩散模型的创造力来自神经网络训练对 score function 产生的 score smoothing,而非随机现象。研究表明,正则化会让模型在训练数据点之间生成新的合理样本,并在高维场景中帮助恢复数据流形。Google Research 同时发布了用于生成论文图表的数值实验代码。

7月6日周一
  1. Hugging Face Blog66

    PRX 第四部分:数据策略

    PRX 团队介绍了其图像生成模型的预训练数据流程:混合公共与内部数据集,使用 VLM 为图像生成长描述,并以 Lance 构建和探索数据、以 Mosaic Data Shards(MDS)供训练流式读取。团队在数亿级数据上采用 JPEG quality 92、分辨率与宽高比分桶、基于 caption 的过滤和感知哈希去重,并选择 Qwen3-VL-8B 作为 captioner。

    推荐理由:文章把 PRX 的大规模图像训练数据流程拆成可复用环节,覆盖数据探索、VLM 重标注、格式转换、过滤去重及工程取舍。

7月1日周三
6月1日周一
  1. Import AI53

    Import AI 459:AI 监督为何困难、蛋白质折叠模型的缩放定律与 AI 系统灭绝风险定价

    Import AI 459 聚焦 AI 经济增长的测量难题、自动化对齐的监督风险,以及如何为 AI 系统的灭绝风险定价。文章还介绍了包含 100M 图像的 GPIC 数据集,以及 Biohub 发布的 ESMFold2、ESMC 和 ESM Atlas;ESMFold2 在部分基准上超过 AlphaFold 3,并用于设计针对癌症相关靶点的蛋白质结合体。

4月23日周四
  1. Google Research77

    Google Photos 在 Auto frame 中提供基于 3D 场景重构的自动改视角功能

    Google Research 宣布,Google Photos 已在 Auto frame 中提供自动重构照片视角的功能。该功能先估计 3D 点图和相机参数,再用生成式 latent diffusion model 补全新视角下原本未拍到的区域,并自动调整人像构图、缓解广角自拍的透视畸变。符合条件的含人物照片可在 Auto frame 候选中获取重构后的第二个版本。

    推荐理由:Google Photos 的 Auto frame 将 3D 场景重建与生成式修补结合,用于自动调整人像视角,呈现生成式编辑从裁剪到视角重构的变化。

7月17日周四
  1. Mistral AI77

    Mistral AI 为 Le Chat 发布 Deep Research、语音模式等多项功能

    Mistral AI 为 Le Chat 发布 Deep Research(Preview)、语音模式、Projects、多语言推理和高级图像编辑等功能。Deep Research agent 可规划问题、搜索资料并生成带引用的结构化报告,语音模式由 Voxtral 驱动,Think mode 由 Magistral 驱动。

    推荐理由:Le Chat此次更新覆盖研究、语音、项目管理和图像编辑,展示了多种交互能力如何集中到同一助手中。