— — 768p → 2× RTX 5090 —
鼠标在画面上左右移动即可擦除对比 —— 光标左边是 A,右边是 B。两条视频严格同帧、同步播放。 开 放大镜 看纹理级差异;按 空格 播放/暂停,← → 逐帧。
本轮的重点是 FlashVSR 原版 vs 调优版,页面默认就开在这两个上;其余方法作为基础参照保留。
| 配置 | 2688×1536 × 141 帧 | 显存峰值 |
|---|---|---|
| 原版(full,kv 3.0,管线默认 VAE 分块) | 385.2 s | 29.15 GiB |
| 调优版(tiny + 2 空间块) | 157.3 s | 20.13 GiB |
2.5× 速度,−31% 显存。15s 容量:16:9 2688×1536 × 360 帧 409.9 s / 20.13 GiB; 21:9 3584×1536 × 360 帧 558.6 s / 22.19 GiB。21:9 只有靠空间分块才成立—— 整幅送进去会死在一个 2.15 GiB 的定长分配上。
24 GB(4090)实测:把 CUDA 分配器硬卡在 23.0 GiB(先用一个已知需 30.5 GiB 的配置做阳性对照, 确认 cap 真的会 OOM),上面四种场景全部通过;15s 21:9 改 3 块后峰值降到 16.44 GiB 而耗时不变(558.0 s), 是 24 GB 卡上更该用的档位。注意:这只模拟了显存预算,没有模拟 sm_89 kernel 和 Ada 更低的带宽, 真 4090 上耗时会更长。
单击设为 A(左),再次单击同一个设为 B(右)。 也可以直接点另一个方法替换 B。
两个配置跑的是同一批片子,所以看的是逐条配对差值,不是各自的均值—— 片子之间的难度差异会在配对里抵消掉。CI 是 2000 次 bootstrap 重采样,种子固定。 差值 = 调优版 − 原版;CI 不跨 0 才算真差异。
「原版」= 作者发布的模型配置(full 管线 / Wan VAE 解码器,kv_ratio 3.0), 跑在同一套内存脚手架里(输入 pad、尾部补 4 帧、scale=2、空间分块)—— 不共用这套脚手架,两次跑的就不是同一批像素,也就没法比。 所以表里原版在 MiniMax 上的峰值是 19.67 GiB 而不是 29.15 GiB: 29.15 是原版配置不分块时的数字,那才是它自己跑 4 Mpx 的代价。
这张表是背景参照,用来给 FlashVSR 的位置定标;本轮的重点是上面那组对比。
—