概述
2024年3月,一段15秒的视频在TikTok上病毒式传播:华金·菲尼克斯版的小丑走上了Summer Smash音乐节舞台,取代了说唱歌手Lil Yachty的出场。步态精准。夹克的摆动分量刚好。角色逐帧锁定在动作上。这不是换脸,而是从一张静态图和一段参考视频生成的全身体动作迁移,出自当时还鲜为人知的多伦多初创公司 Viggle AI。公开上线五个月内,平台Discord社区成员达到400万,据TechCrunch报道。
Viggle 的核心判断是:对大量创作者而言,精准比炫目更重要。一段舞蹈短视频、一个 meme 模板、一个直播虚拟形象:这些场景要求角色精确复现动作,而不是大致像那么回事。Runway 或 Kling 3.0 等通用视频生成工具可以从文字提示词产出电影级画面,但它们不解决"让特定角色做出特定动作,且关节精度到位"的问题。
JST-1:物理引擎而非像素插值
Viggle 的底层模型 JST-1,公司称之为视频-3D基础模型。与依赖像素模式插帧的方法不同,JST-1 从参考视频中重建3D骨骼,再将其映射到目标角色图像上,期间遵循关节约束、足部接触和布料物理。公司称其为首个"真正理解物理"的同类模型,,ChatForest的评测指出,这个说法比大多数AI营销用语更经得起检验:输出结果展示的是正确的重量分布,而不仅仅是视觉上过得去。
技术背景值得关注。创始人兼CEO Hang Chu 是计算机视觉研究员,曾在Autodesk、Meta、NVIDIA和Google任职,2022年在多伦多创办 Viggle。他的学术背景包括在多伦多大学师从 Raquel Urtasun(后创办自动驾驶公司Waabi)和 Sanja Fidler(现任职NVIDIA)的博士研究。截至2026年初,团队规模约31至36人,base在多伦多。
能做什么
Viggle 的功能集已远超最初的 meme 生成器。核心模式包括:
- Mix:上传一张角色图和一段动作视频,Viggle 将动作迁移到角色上。那个小丑视频就是 Mix 模式的作品。
- Multi:同一场景中动画化多个角色,每个角色可接入独立的动作源。
- Move:用文字提示词而非参考视频来引导角色动作。
- Real-Time Swap:直播中的面部和身体替换。免费版每天5分钟,Max 套餐无限制。
2025年,Viggle 推出了 PINOC,一个独立工具,可以从任意视频画面中提取骨骼动画数据,导出为 FBX 或 GLB 文件供3D软件使用。同期还发布了 Fight Anyone 3D,一款AI驱动的格斗游戏,用同一生成模型实时渲染自定义角色的对战场景。
平台提供 API,文档见 docs.viggle.ai,供开发者将动作迁移集成到自有应用中。
公司与融资
Viggle 于2024年8月完成1900万美元A轮融资,由 Andreessen Horowitz(a16z)领投,Two Small Fish Ventures 参投,据BusinessWire。总融资额约2700万加元。公司宣称截至2026年拥有超过4000万用户,涵盖网页端和移动端。Discord 仍是主要社区阵地,公司在关于页面上强调其 Discord 排名。
价格(截至2026-07-09)
| 套餐 | 月费 | 点数 | 并发生成 | 水印 | 实时换脸 |
|---|---|---|---|---|---|
| Free | $0 | 无(5个视频/天) | 1 | 有 | 5分钟/天 |
| Pro | $9.99(年付$7.99) | 80 | 4 | 无 | 30分钟/天 |
| Live | $19.99(年付$15.99) | 200 | 6 | 无 | 400分钟/天 |
| Max | $79.99(年付$63.99) | 800 | 10 | 无 | 无限制 |
点数按生成消耗,不同模型和功能消耗点数不同,据Viggle定价FAQ。月付点数在账单日过期,购买的点数不过期但需保持有效订阅才能使用。
定位
Viggle 占据了一个介于多个大品类之间的利基。它不是文字生成电影级画面的工具(那是 Runway、Kling 的领地),也不是数字人播报平台(HeyGen、Synthesia)。在精神上最接近的是 Pixverse AI 等动作控制工具,但 Viggle 更侧重物理保真度和角色一致性,而非场景多样性。
这种专注有其代价。输出分辨率低于专用电影级生成器。免费套餐在服务器繁忙时生成速度会受影响。复杂的多角色遮挡场景可能出现可见伪影。工具在源动作干净、角色居中且光线充足的条件下表现最佳,这些条件更利于棚拍式内容而非随手拍素材。
竞品对比
Runway Gen-4 和 Kling 3.0 产出更高分辨率的电影级画面,支持文字生成场景,这是 Viggle 不参与竞争的领域。HeyGen 和 Synthesia 聚焦企业视频的数字人播报,属于不同使用场景。在动作专用工具中,Pixverse AI 提供角色动画但偏向风格化输出,而非物理精确的动作迁移。
Viggle 的优势在于骨骼追踪的精度。当角色需要精确复现参考视频中的舞蹈动作、步态循环或手势时,Viggle 能提供逐帧级别的保真度,这是通用生成器不优先考虑的指标。代价是更窄的能力范围:无场景生成,无文字转视频,输出分辨率较低。对只需要那段动作的创作者而言,这个取舍是成立的。
Viggle 的 Discord 服务器在上线五个月内达到400万成员,至今仍是核心分发渠道。用户在社区频道分享模板、动作片段和二次创作。公司定期举办主题挑战赛,在 TikTok 和 X 上产出病毒式内容,形成"病毒输出驱动新注册"的增长闭环。
局限
Viggle 不生成文字描述的场景,不产出高分辨率电影级画面。免费版带水印,且一次只能生成一个视频。Real-Time Swap 需要稳定网络,对正面、均匀光照的主体效果最好。公司宣称的4000万用户数据为自报数据,包含免费注册用户,活跃用户数缺乏独立验证。