它座落在兩種失敗之間
線性媒體完全忠實,也完全僵硬。每個像素都是真的,而你唯一能問的問題是「什麼時候」。
像素直接生成什麼問題都能回答,什麼都不保證。身份在影格之間漂移,而且沒有任何結構能把它固定住 —— 因為模型產生的是外觀,不是一個「擁有外觀的對象」。
MS3E 的立場是:中間那個有用的東西是一個明確的結構 —— 一副不動的身份骨架、疊在它上面的形變、各自持有細節的區域,以及一組把「必須保留的」與「可以重生的」分開的光譜分解。
狀態向量定址什麼
這些是出貨場景實際宣告的軸。改動其中一個會把一組節點標記為 dirty,只有那些會被重建。
- headYaw
- headPitch
- eyeYaw
- eyePitch
- expression
- accentHue
- quality
- frequencyGain
它是什麼、不是什麼
- 研究性質的 MVP,不是生產用的影片編碼器。它是白皮書那套模型的參考實作。
- 殘差誤差下降 99.210%(Spectral Portrait)與 97.421%(Amber Sentinel)是這兩組素材的量測值,不是通用宣稱。
- 兩個角色,都由匯入的基準素材推導而來。這裡沒有任何東西是訓練出來的;結構是抽取加上手工調校。
- 瀏覽器驗收是在桌機版 Chrome 144 上跑的。行動裝置的 GPU 路徑未經測試。
- repo 裡的 v0.1 JSON Schema 描述的是 v0.1 場景格式,v1.0 已經不用了。目前沒有對應 v1.0 格式的公開 schema。