2026年9月10日

科技

谷歌 釋出 4D 世界模型,速度較 SOTA 提升 300 倍

Google DeepMind 最新發布的 D4RT(Dynamic 4D Reconstruction and Tracking),正在重塑計算機視覺對“動態世界”的理解方式。 長期以來,動態 4D...

Google DeepMind 最新發布的 D4RT(Dynamic 4D Reconstruction and Tracking),正在重塑計算機視覺對“動態世界”的理解方式。

長期以來,動態 4D 重建一直是計算機視覺領域最複雜、也最昂貴的問題之一。工程師通常需要將光流估計、深度預測、相機位姿恢復、動態物體分離等多個模型串聯成冗長而脆弱的流水線,不僅計算成本高昂,還極易在誤差累積中崩潰。

D4RT 選擇徹底推翻這一範式。

它用一個統一的「時空查詢(spatio-temporal query)」介面,將原本割裂的 全畫素追蹤、深度估計、相機位姿與動態重建 融合為一個整體問題。模型不再逐幀處理影片,而是先“整體理解”整段影片,再按需查詢任何時間、任何畫素的 3D 狀態。

在標準基準測試中,D4RT 在保持精度領先的同時,推理速度比現有 SOTA 方法快 18 至 300 倍。這意味著,原本只能在離線環境、影視級算力下完成的 4D 重建,第一次具備了走向機器人、自動駕駛和 AR 裝置的現實可能。

為什麼它看起來“像人一樣在看世界”

D4RT 的一個核心突破,在於它對“動態混亂”的處理能力。

傳統 3D 重建演算法往往假設世界是靜止的,一旦遇到運動物體,就會在 3D 空間中產生嚴重的重影與撕裂。而 D4RT 能夠清晰地區分 相機運動物體自身運動,在時序維度上保持幾何一致性。

更進一步,D4RT 支援真正意義上的 全畫素級 3D 追蹤
你可以選中影片中任意一個畫素,模型就能給出該點在過去與未來的完整三維軌跡,即便該點被遮擋或短暫消失,模型仍能基於全域性上下文進行合理推斷。

這種體驗不再像是在“逐幀分析影片”,而更像是 AI 在內部構建了一個可隨時間自由檢索的四維世界模型。

300 倍加速,是否只是話術?

DeepMind 所提到的 “300 倍”,並非單純的單幀速度對比,而是 吞吐量維度的提升:在相同幀率下,D4RT 可以並行追蹤數量級更多的 3D 軌跡。

換句話說,舊方法只能“盯住主角”,而 D4RT 可以同時理解前景人物、背景行人、環境細節與遠處動態目標,實現真正的 密集動態感知

架構上的關鍵差異

當前 4D 重建方法大致分為兩類:

  • 流水線拼裝型:多個模型串聯,慢且脆弱
  • 多頭輸出型:一個大模型,但依賴多個解碼頭,結構複雜

D4RT 的不同之處在於:它只有一種查詢介面
深度、軌跡、點雲、位姿,都只是對同一個時空函式的不同提問方式。

由於查詢天然可並行,D4RT 將一個傳統的序列幾何問題,轉化為了高度並行的“搜尋問題”,這是其速度飛躍的根本原因。

當然,這種高效並非沒有代價。D4RT 在訓練階段依然極其昂貴:
其編碼器規模達到十億級引數,需要在數十個 TPU 上訓練數天。這是一件典型的“大廠級重武器”。

對產業的意義

D4RT 的價值,並不止於一篇論文。

  • 具身智慧與機器人
    讓機器不只是“看到物體”,而是理解物體在時間中的運動趨勢。
  • 自動駕駛
    畫素級動態軌跡預測,是提升安全性的關鍵能力。
  • 增強現實(AR)
    高效、低延遲的 4D 感知,是虛實融合體驗的基礎設施。

對普通使用者而言,這類技術未來也可能重塑影片編輯、影像創作與沉浸式內容體驗。

結語

D4RT 展示了一種新的方向:
AI 對世界的理解,正在從二維的“識別影像”,邁向四維的“洞察時空”。

在這種視角下,過去與未來不再是消失或未知的狀態,而只是同一個四維空間中,等待被查詢的不同座標而已。

接著讀

港股又現“黃金坑”?

自 10 月初以來,恒生科技指數一度下挫約 20%,但內地南向資金及港股 ETF(如恒生科技指數 ETF 513180、恒生網際網路 ETF 513330)逆勢加倉。 截至 12 月 1 日,南下資金淨...

279 天前