MS3E多層嵌套光譜骨架狀態引擎 EN

v1.0.1

影片只能沿著一條軸尋址。

你 seek 到一個時間點,就只能拿到那裡錄到的東西。你沒辦法要求「同一個對象再轉過去一點」,或者「同一個瞬間但不同細節層級」—— 因為檔案裡根本沒有「對象」與「細節」這兩個概念,只有影格。MS3E 把媒體編譯成一個有這些概念的結構,再依狀態向量重建。

2個角色
4個場景
747個受管檔案
11組測試

它座落在兩種失敗之間

線性媒體完全忠實,也完全僵硬。每個像素都是真的,而你唯一能問的問題是「什麼時候」。

像素直接生成什麼問題都能回答,什麼都不保證。身份在影格之間漂移,而且沒有任何結構能把它固定住 —— 因為模型產生的是外觀,不是一個「擁有外觀的對象」。

MS3E 的立場是:中間那個有用的東西是一個明確的結構 —— 一副不動的身份骨架、疊在它上面的形變、各自持有細節的區域,以及一組把「必須保留的」與「可以重生的」分開的光譜分解。

狀態向量定址什麼

這些是出貨場景實際宣告的軸。改動其中一個會把一組節點標記為 dirty,只有那些會被重建。

  • headYaw
  • headPitch
  • eyeYaw
  • eyePitch
  • expression
  • accentHue
  • quality
  • frequencyGain

它是什麼、不是什麼

  • 研究性質的 MVP,不是生產用的影片編碼器。它是白皮書那套模型的參考實作。
  • 殘差誤差下降 99.210%(Spectral Portrait)與 97.421%(Amber Sentinel)是這兩組素材的量測值,不是通用宣稱。
  • 兩個角色,都由匯入的基準素材推導而來。這裡沒有任何東西是訓練出來的;結構是抽取加上手工調校。
  • 瀏覽器驗收是在桌機版 Chrome 144 上跑的。行動裝置的 GPU 路徑未經測試。
  • repo 裡的 v0.1 JSON Schema 描述的是 v0.1 場景格式,v1.0 已經不用了。目前沒有對應 v1.0 格式的公開 schema。