跳到内容

PaintsUndo

PaintsUndo:输入单张图片,生成完整绘画过程视频。

免费github.com/lllyasviel/Paints-UNDO
访问

PaintsUndo 是一款免费的 AI 工具,支持PaintsUndo generates drawing-process timelapses from a single image.。本页汇总了它的概览、事实与相关替代方案。

定价
免费
平台
PaintsUndo generates drawing-process timelapses from a single image.

决策摘要

PaintsUndo

概述

点开 PaintsUndo 演示视频。一幅动漫插画满满当当地铺在屏幕上,每一处阴影、每一点高光都已完成。然后视频倒放。颜色从画布上剥离。线条逐根回缩。人物分解为粗糙的几何块,最后只剩一片空白。看起来像某个画师的真实录制被倒着播放。但这里没有人类落过笔。AI 从一张成品图凭空编造了整个绘画过程。

Paints-UNDO 草图提取示例

该项目是一个研究计划,只做一件事:输入任意一张图,输出一段看起来可信的绘画过程视频。包括草图、描线、上色、调整图层、中途改主意,所有那些真实创作中会发生的动作。视频通常 25 秒、每秒 4 帧。关键不是还原,而是看起来像。模型不是在恢复一段真实录屏,而是在编造一段能骗过肉眼的。

原理

名字来自撤销命令,即大多数软件的 Ctrl+Z。模型沿着 1,000 步假想操作一路退到空白画布:0 是成品,999 是第一笔。

底层是两段式流水线。首先,单帧模型接收输入图和操作步数,输出该阶段应有的画面。在不同步数位置跑 5 到 7 次,就得到关键帧:草图阶段、线稿阶段、平涂阶段的大致快照。然后多帧模型在每对关键帧之间插值生成 16 个中间帧,串起来就是一段 100 到 500 帧的视频。

单帧模型是一个魔改版 Stable Diffusion 1.5:噪声调度器的 betas 终点从 0.012 改为 0.020,永久移除 CLIP 末层(等效 CLIP Skip 2),操作步数通过额外嵌入注入。最关键的是:它用 WD14 tagger 提取提示词,而非人工撰写。据项目 README,用其他方式会产出有缺陷的结果。

多帧模型的初始权重继承自 VideoCrafter,但经过了大量重训,3D-UNet 加入了跨帧时序注意力窗口。其 VAE 来自 ToonCrafter 的动漫时序 VAE,这也在一定程度上解释了它在插画风格输入上效果最佳。

谁做的

该项目出自 Lvmin Zhang(GitHub: lllyasviel),斯坦福大学博士生。张是开源 AI 图像生成领域最具影响力的人物之一:他此前构建了 ControlNet,让用户通过边缘图、姿态骨架、深度图来精确引导 Stable Diffusion。该项目已获超过 29,000 个 GitHub star。他还创建了 Fooocus(简化版 SD 界面)和 Omost(LLM 驱动的图像构图工具)。

项目于 2024 年 7 月 7 日发布,至今累计 4,000 多个 star、近 400 个 fork。2025 年 8 月,张预告了续作 PaintsAlter,将概念扩展为撤销加重做,可从同一输入探索多个分支绘画过程。

官方 README 中有一条不寻常的警告:此 GitHub 仓库是 PaintsUndo 的唯一官方页面。我们没有其他任何网站。请注意,近期 Google 和社交媒体上出现了许多假冒 PaintsUndo 网站。paintsundo.com 是一个 HuggingFace 社区成员的第三方 Gradio 封装,与项目无关。

现实核查

它生成的是可信的绘画过程,不是真实的。官方演示页的所有输入图片都是 AI 生成的。这些图片本来就没有真实的绘画历史。模型在猜,而猜得像个样子,因为数字绘画流程本身有规律可循。

这既是技术成就,也是一个值得警惕的信号。从技术面看,模型捕捉到了翻画布、调色曲线、中途改构图等行为。这些细节非专业观众不会注意,但内行一眼能认出其合理性。另一方面,正如 BoingBoing 的 Rob Beschizza 指出的,这个工具展示了伪造的绘画过程录像可以多轻易地以假乱真,瓦解了艺术家用来证明亲手画的那一类证据。

项目页面本身对局限性也很坦诚。失败案例中,有的绘画序列坍缩成不可辨认的色块,有的中途丢失了主体,有的撤销轨迹与人类构图逻辑毫无关系。

怎么跑

Paints-UNDO 通过 Gradio 网页界面本地运行。硬件门槛不低:推理在 Nvidia 4090 和 3090TI(24GB 显存)上测试通过。16GB 或许能跑,8GB 不行。张估计在极限优化(权重卸载加切片注意力)下,理论最低需 10 到 12.5 GB。

处理一张图耗时 5 到 10 分钟。产出为 25 秒、4 FPS 的视频,分辨率 320 乘 512 或其转置。如果没有达标 GPU,没有官方云托管选项。不过社区有一个 HuggingFace Space 可用,预计排队且可能受资源限制。

部署流程为标准 conda 操作:clone 仓库、创建 Python 3.10 环境、安装 xformers 和依赖、启动 gradio_app.py。

该项目完全免费开源。无付费层级、无 SaaS 订阅、无 API。唯一成本是你自己的算力。对于想以相反方向处理图像的用户,Image to Line 将成品图转为干净线稿。如果需要云端视频生成、免除硬件负担,Kling 3.0Wan 2.7 提供托管方案,但二者都无法复现 该项目特有的撤销式绘画过程视频能力。

常见问题

Paints-UNDO 做什么?

输入一张图片,生成一段模拟绘画过程的视频。如同观看画师从草图、描线、上色到调整的全过程。

Paints-UNDO 免费吗?

完全免费开源,代码托管于 lllyasviel/Paints-UNDO。无付费版本或商业服务。

需要什么硬件?

推荐至少 16GB 显存的 Nvidia GPU。已在 RTX 4090 和 3090TI(24GB)上测试。8GB 显卡无法运行。理论最低约 10 到 12.5 GB(需激进优化)。

Paints-UNDO 能还原真实的绘画过程吗?

不能。它生成的是模拟的、看似可信的过程。官方演示的所有输入图均为 AI 生成。这些图片原本就没有真实的绘画历史可供还原。

谁做的 Paints-UNDO?

Lvmin Zhang(lllyasviel),斯坦福大学博士生,也是 ControlNet、Fooocus 和 Omost 的创建者。

paintsundo.com 是官网吗?

不是。GitHub 仓库是唯一官方来源。项目 README 明确警告了第三方仿冒网站。

访问官网前

决策核对台

在依赖该产品或访问官网前,最值得先确认的问题。

01Paints-UNDO 做什么?

输入一张图片,生成一段模拟绘画过程的视频。如同观看画师从草图、描线、上色到调整的全过程。

请在官网核验

02Paints-UNDO 免费吗?

完全免费开源。无付费版本或商业服务。

请在官网核验

03需要什么硬件?

推荐至少 16GB 显存的 Nvidia GPU。已在 RTX 4090 和 3090TI(24GB)上测试。8GB 显卡无法运行。

请在官网核验

显示另外 3 个问题
04能还原真实的绘画过程吗?

不能。它生成的是模拟的过程。官方演示的所有输入图均为 AI 生成。

请在官网核验

05谁做的?

Lvmin Zhang(lllyasviel),斯坦福大学博士生,也是 ControlNet、Fooocus 和 Omost 的创建者。

请在官网核验

06paintsundo.com 是官网吗?

不是。GitHub 仓库是唯一官方来源。

请在官网核验

读完了?打开 PaintsUndo 亲自判断。

访问 PaintsUndo