SplaTAM
SplaTAM 以等向性、顏色不隨視角變化的三維高斯為唯一地圖。追蹤時固定高斯,只在剪影值大於 0.99 的已充分觀測像素上,以深度 L1 與權重減半的顏色 L1 最佳化位姿(以等速模型初始化);建圖時依剪影與深度誤差新增高斯,並以重疊度最高的關鍵影格更新地圖。高斯初始位置直接取自 RGB-D 深度反投影,故幾何來源是量測深度。全文與補充資料都沒有三維表面精度指標,幾何只以渲染深度 L1 評估(ScanNet++ 新視角 2.07 cm、訓練視角 1.28 cm)。Replica、TUM-RGBD 與 ScanNet 的基準數值取自 Point-SLAM 論文而非重跑;在 TUM-RGBD 上平均 ATE 5.48 cm,仍不及特徵式 ORB-SLAM2 的 1.98 cm。在 RTX 3080 Ti 上每影格追蹤約 1.00 s、建圖約 1.44 s,並非即時。
本頁內容
Dense RGB-D SLAM with isotropic 3D Gaussians, silhouette-guided tracking and densification, evaluated by rendering, depth L1 and ATE.
技術屬性
欄位內容為文獻擷取紀錄的原文用語(英文),以原文為據;「未查證」表示本研究尚未讀到該資訊,不代表該方法不具備此能力。
| 感測輸入 | RGB-D |
|---|---|
| 原文測試平台 | 未記錄 |
| 狀態估計 | gradient-based camera pose optimization through differentiable splatting (constant-velocity initialization); map update over overlapping keyframes |
| 資料關聯 | direct L1 depth + colour rendering losses on silhouette-masked (well-observed) pixels |
| 時間表示 | discrete poses |
| 去畸變 | 不適用 |
| 迴圈閉合 | none |
| 全域最佳化 | none |
| 地圖表示 | isotropic 3D Gaussians with view-independent colour |
| 先驗資訊 | none; Gaussians initialized by unprojecting sensor depth |
| 可輸出幾何 | Gaussian map with rendered RGB and depth; geometry assessed only through rendered depth L1 against ground-truth depth (ScanNet++ 2.07 cm on novel views, 1.28 cm on training views); the full paper and supplement contain no 3D surface metric |
| 計算需求 | RTX 3080 Ti: 1.00 s tracking and 1.44 s mapping per frame on Replica room0 (40 and 60 iterations); SplaTAM-S 0.19 s and 0.33 s (Table 6); rendering up to 400 FPS at 876x584 (Fig. 1) |
使用設備
原文使用的感測器、運算硬體與載具(equipment)。型號保留原文寫法,連結到設備頁中同一型號的歸併名稱;角色依原文用途分為方法輸入、資料集感測器、執行運算平台、參考或真值量測(reference or ground truth)與比較對象設備。
| 類別 | 型號(原文寫法) | 角色 | 資料集 | 原文規格 | 出處 |
|---|---|---|---|---|---|
| 相機 | DSLR (model not stated in the paper) | 資料集感測器 | ScanNet++ | ScanNet++ DSLR captures with complete dense trajectories and a second capture loop for novel views | (Keetha et al., 2024, Sec. 4) |
| RGB-D 相機 | iPhone (commodity camera and time-of-flight sensor) | 方法輸入 | 未標示 | Qualitative online reconstructions shown on the project website only; no quantitative evaluation | (Keetha et al., 2024, Supplementary S1) |
| 運算硬體 | NVIDIA RTX 3080 Ti | 執行運算平台 | 未標示 | Runtime comparison on Replica room0 | (Keetha et al., 2024, Table 6; Sec. 5) |
論文圖片
只收錄原文以開放授權(open license)釋出的圖片,並依授權條件標示出處、圖號、授權與修改方式。

Fig. 1SplaTAM 高斯地圖、訓練與新視角相機視錐,以及渲染與深度誤差示例
出處:Keetha et al., 2024,Fig. 1。授權:CC BY-SA 4.0 (arXiv v3)。原始圖檔。修改:縮小至寬度不超過 1400 px,並轉存為 WebP 格式。

Fig. 2SplaTAM 流程:剪影引導追蹤、高斯增密與地圖更新三步驟
出處:Keetha et al., 2024,Fig. 2。授權:CC BY-SA 4.0 (arXiv v3)。原始圖檔。修改:縮小至寬度不超過 1400 px,並轉存為 WebP 格式。

Fig. S.1ScanNet++ S2 的重建結果與估計、真值相機位姿比對
出處:Keetha et al., 2024,Fig. S.1。授權:CC BY-SA 4.0 (arXiv v3)。原始圖檔。修改:轉存為 WebP 格式。
作者報告的優勢與限制
優勢
- Sub-centimetre localization claims in texture-less real scenes (Fig. 1 caption)
- Faster optimization than implicit representations thanks to rasterization (Sec. 1)
限制
- Sensitive to motion blur, large depth noise and aggressive rotation (Limitations)
- Requires known intrinsics and dense depth (Limitations)
- Scaling to large scenes left to future work (Limitations)
- Feature-based ORB-SLAM2 outperforms SplaTAM on TUM-RGBD (1.98 vs 5.48 cm average ATE) and no dense method reaches below 10 cm on original ScanNet (Table 1; Sec. 5)
- Replica, TUM-RGBD and ScanNet baseline numbers are copied from Point-SLAM rather than rerun (Sec. 4; Table 1 caption)
- (inference) Not real time: about 1.00 s tracking plus 1.44 s mapping per frame on an RTX 3080 Ti (Table 6)
營建工程相關證據
論文未涉及營建場域;資料為 ScanNet++、Replica、TUM-RGBD、ScanNet。
原文驗證環境:模擬、公開基準
報告的性能數據
以下是原文作者報告的性能數值(author-reported results),不是本研究重新量測的結果。每張圖只並列同一個比較組(comparison group,同一張表、同一組實驗設定)內的方法;不同比較組之間的數值不可直接比較,也不構成排名。
本方法共出現在 29 個比較組,合計 163 筆紀錄。以下列出本方法紀錄最多的 4 組,其餘 25 組列在最後,並連到性能比較頁。
Keetha et al., 2024 · Table 1 本方法 25 筆
指標ATE RMSE [cm]
表格設定(擷取紀錄原文):Online camera-pose estimation, ATE RMSE [cm]; Baseline numbers taken from Point-SLAM; SplaTAM averaged over 3 seeds (Keetha et al., 2024, Table 1)
ATE RMSE [cm],TUM-RGBD · Avg.
只並列這張表在相同設定下報告的方法;以「本方法:」開頭者為本頁方法。失敗、未執行與未報告以標記呈現,不是 0。
按 Tab 進入圖表後,用上下方向鍵逐一瀏覽各類別,Esc 關閉提示框;也可開啟表格檢視閱讀全部數值。
這些是 Keetha et al., 2024 在此表設定下報告的數值(author-reported results),只能在同一個比較組內對照,不代表方法在其他資料或設定下的表現。
資料來源作者報告值(Keetha et al., 2024, Table 1)
| 方法(原文寫法) | 報告值 | 出處 |
|---|---|---|
| Point-SLAM | 8.92 cm | (Keetha et al., 2024, Table 1) |
| SplaTAM本方法原文提出 | 5.48 cm | (Keetha et al., 2024, Table 1) |
| Vox-Fusion | 11.31 cm | (Keetha et al., 2024, Table 1) |
| NICE-SLAM | 15.87 cm | (Keetha et al., 2024, Table 1) |
| Kintinuous | 4.84 cm | (Keetha et al., 2024, Table 1) |
| ElasticFusion | 6.91 cm | (Keetha et al., 2024, Table 1) |
| ORB-SLAM2 | 1.98 cm | (Keetha et al., 2024, Table 1) |
Xiao et al., 2025 · Table II 本方法 18 筆
表格設定(擷取紀錄原文):Tracking accuracy with rpg trajectory evaluation: t_rel = average translational RMSE drift (%), r_rel = average rotational RMSE drift (deg/100 m), t_abs = ATE RMSE (m); reference trajectories from R3LIVE (not an independent measurement); alignment not stated; IMU not used by LiV-GS; '-' entries reported without explanation (text says indoor-oriented 3DGS SLAM methods degrade or fail on some outdoor sequences) (Xiao et al., 2025, Table II)
t_rel (average translational RMSE drift),NTU4DRadLM · cp
只並列這張表在相同設定下報告的方法;以「本方法:」開頭者為本頁方法。失敗、未執行與未報告以標記呈現,不是 0。
- 未報告(沒有數值,不是 0)
按 Tab 進入圖表後,用上下方向鍵逐一瀏覽各類別,Esc 關閉提示框;也可開啟表格檢視閱讀全部數值。
這些是 Xiao et al., 2025 在此表設定下報告的數值(author-reported results),只能在同一個比較組內對照,不代表方法在其他資料或設定下的表現。
資料來源作者報告值(Xiao et al., 2025, Table II)
| 方法(原文寫法) | 報告值 | 出處 |
|---|---|---|
| NeRF-LOAM | 2.943% | (Xiao et al., 2025, Table II) |
| HDL-graph-SLAM | 1.264% | (Xiao et al., 2025, Table II) |
| ORB-SLAM3 | 1.356% | (Xiao et al., 2025, Table II) |
| SplaTAM本方法 | 無數值未報告註記(擷取紀錄):not reported ('-' in table) | (Xiao et al., 2025, Table II) |
| MonoGS | 4.171% | (Xiao et al., 2025, Table II) |
| Gaussian-SLAM | 1.249% | (Xiao et al., 2025, Table II) |
| GS-ICP-SLAM | 5.471% | (Xiao et al., 2025, Table II) |
| Ours原文提出 | 0.234% | (Xiao et al., 2025, Table II) |
Lang et al., 2025 · Table I 本方法 12 筆
表格設定(擷取紀錄原文):Rendering quality; compared methods mapped with ground-truth poses (MCD) or Gaussian-LIC estimated poses (FAST-LIVO, R3LIVE); FAST-LIVO and R3LIVE use a solid-state LiDAR, MCD a spinning LiDAR (Lang et al., 2025, Table I)
PSNR (dB),FAST-LIVO · f0 hku2
只並列這張表在相同設定下報告的方法;以「本方法:」開頭者為本頁方法。失敗、未執行與未報告以標記呈現,不是 0。
按 Tab 進入圖表後,用上下方向鍵逐一瀏覽各類別,Esc 關閉提示框;也可開啟表格檢視閱讀全部數值。
這些是 Lang et al., 2025 在此表設定下報告的數值(author-reported results),只能在同一個比較組內對照,不代表方法在其他資料或設定下的表現。
資料來源作者報告值(Lang et al., 2025, Table I)
| 方法(原文寫法) | 報告值 | 出處 |
|---|---|---|
| NeRF-SLAM (train view) | 25.56 dB | (Lang et al., 2025, Table I) |
| MonoGS (train view) | 23.58 dB | (Lang et al., 2025, Table I) |
| SplaTAM with LiDAR pseudo RGB-D (train view)本方法 | 25.51 dB | (Lang et al., 2025, Table I) |
| Gaussian-LIC (train view)原文提出 | 29.89 dB | (Lang et al., 2025, Table I) |
| Gaussian-LIC (novel view)原文提出 | 29.28 dB | (Lang et al., 2025, Table I) |
Ha et al., 2024 · Table 1 本方法 9 筆
指標ATE RMSE [cm]
表格設定(擷取紀錄原文,這些數值分屬表中不同部分):(Ha et al., 2024, Table 1)
- Replica ATE RMSE; * = reproduced with official code; GS-SLAM from its paper, Photo-SLAM only average from its paper
- Replica ATE RMSE; * = reproduced with official code; GS-SLAM from its paper, Photo-SLAM only average from its paper; the Gaussian Splatting SLAM (MonoGS) row appears only in the ECCV version of record, reproduced with official code and evaluated on keyframes only
- Replica ATE RMSE; the ECCV 2024 version of record (Table 1) adds an ORB-SLAM3 average taken from Photo-SLAM [12]; per-scene cells are '-'
ATE RMSE [cm],Replica · average of 8 scenes
只並列這張表在相同設定下報告的方法;以「本方法:」開頭者為本頁方法。失敗、未執行與未報告以標記呈現,不是 0。
按 Tab 進入圖表後,用上下方向鍵逐一瀏覽各類別,Esc 關閉提示框;也可開啟表格檢視閱讀全部數值。
這些是 Ha et al., 2024 在此表設定下報告的數值(author-reported results),只能在同一個比較組內對照,不代表方法在其他資料或設定下的表現。
資料來源作者報告值(Ha et al., 2024, Table 1)
| 方法(原文寫法) | 報告值 | 出處 |
|---|---|---|
| NICE-SLAM* [ 47 ] | 1.42 cm | (Ha et al., 2024, Table 1) |
| Point-SLAM* [ 32 ] | 0.54 cm | (Ha et al., 2024, Table 1) |
| GS-SLAM [ 44 ] | 0.5 cm | (Ha et al., 2024, Table 1) |
| Photo-SLAM [ 12 ] | 0.6 cm | (Ha et al., 2024, Table 1) |
| SplaTAM* [ 14 ]本方法 | 0.36 cm | (Ha et al., 2024, Table 1) |
| Ours (limited to 30 FPS)原文提出 | 0.16 cm | (Ha et al., 2024, Table 1) |
| Gaussian Splatting SLAM* [22] (ECCV version only) | 0.32 cm | (Ha et al., 2024, Table 1 (ECCV 2024 version of record)) |
| ORB-SLAM3 [4] (ECCV version only) | 1.8 cm | (Ha et al., 2024, Table 1 (ECCV 2024 version of record)) |
其他比較組
列出其餘 25 個比較組
- Hong et al., 2025 · Table III
- Yan et al., 2026b · Table III
- Hong et al., 2025 · Table I
- Peng et al., 2024 · Table 1
- Keetha et al., 2024 · Table 3
- Keetha et al., 2024 · Table 6
- Deng & Gan, 2026 · Table 11
- Lang et al., 2025 · Table II
- Ha et al., 2024 · Table 2
- Ha et al., 2024 · Table 3
- Ha et al., 2024 · Table 4
- Peng et al., 2024 · Supp. Table 5
- Peng et al., 2024 · Table 2
- Peng et al., 2024 · Table 3
- Yuan et al., 2026 · Table 3
- Deng & Gan, 2026 · Table 1
- Xiao et al., 2025 · Table IV
- Yan et al., 2026b · Table VI
- Yuan et al., 2026 · Table 4
- Peng et al., 2024 · Supp. Table 7
- Tosi et al., 2026 · Table XI
- Deng & Gan, 2026 · Table 2
- Deng & Gan, 2026 · Table 9
- Zhang et al., 2025 · Table I
- Peng et al., 2024 · Supp. Table 6
來源
Keetha et al., 2024
(2024)SplaTAM: Splat, Track & Map 3D Gaussians for Dense RGB-D SLAM2024 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 21357-21366
DOI 10.1109/cvpr52733.2024.02018arXiv 2312.02126程式碼
同儕審查已出版已讀全文近十年
相關版本
- 預印本:arXiv:2312.02126 https://arxiv.org/abs/2312.02126
程式碼:https://github.com/spla-tam/SplaTAM(授權:BSD-3-Clause)。有公開程式碼不等於已被重現,也不代表目前版本與論文版本相同。