圖生影片技術地圖:2026 年 I2V 的架構、模型與真實價格
圖生影片(I2V)在 2026 年的骨幹清一色是 latent diffusion + DiT,畫質已經不是選型軸;真正的軸是原生音訊、能不能自架、每秒多少錢。三個容易踩的坑:Sora 的 app 已在 4/26 關閉、API 9/24 關;Wan 2.7 被大量文章稱為 Apache 2.0 開源但一手來源查無權重;Veo 3.1 官方價是 $0.40/s 而非二手網站流傳的 $0.75/s。
圖生影片(I2V)在 2026 年的骨幹清一色是 latent diffusion + DiT,畫質已經不是選型軸;真正的軸是原生音訊、能不能自架、每秒多少錢。三個容易踩的坑:Sora 的 app 已在 4/26 關閉、API 9/24 關;Wan 2.7 被大量文章稱為 Apache 2.0 開源但一手來源查無權重;Veo 3.1 官方價是 $0.40/s 而非二手網站流傳的 $0.75/s。
2026 年 3D 生成的核心範式是「video diffusion → feed-forward 3D 重建」,Lyra 2.0 是這條線的代表作。但 CVPR 2026 的三篇 Best Paper 暗示下一波轉向:SAM 3D 帶來 foundation model 級別的物件重建、D4RT 用統一 transformer 數秒重建動態 4D、O-Voxel 用結構化 latent 取代 Gaussian。3DGS 仍是主流但正在被表面原語挑戰,pixel-space diffusion 正在反攻 latent-space。