Hash-grid plus coordinate encoding with global BA over all keyframes; authors show mesh-culling choices materially change reconstruction metrics.

技術屬性

欄位內容為文獻擷取紀錄的原文用語(英文),以原文為據;「未查證」表示本研究尚未讀到該資訊,不代表該方法不具備此能力。

Co-SLAM 的技術屬性
感測輸入RGB-D
原文測試平台未記錄
狀態估計gradient-based per-frame tracking (constant-speed initialization) + global bundle adjustment over rays sampled from all keyframes
資料關聯direct colour and depth rendering losses + approximate SDF and smoothness losses
時間表示discrete poses
去畸變不適用
迴圈閉合none (authors suggest incorporating loop closure as future work)
全域最佳化global bundle adjustment jointly optimizing the scene representation and all keyframe poses
地圖表示multi-resolution hash grid + one-blob coordinate encoding with shallow MLPs predicting TSDF and colour
先驗資訊none (RGB-D measurements with known intrinsics)
可輸出幾何mesh via marching cubes, evaluated after mesh culling
計算需求Intel Core i7-12700K (3.60 GHz) + NVIDIA RTX 3090 Ti; 17.4 FPS on Replica, 15.6 FPS on Synthetic RGB-D, 12.8 FPS on ScanNet and 13.3 FPS on TUM with default settings; about 6.4 to 6.7 FPS with doubled tracking iterations; 0.26 M to 1.6 M parameters (Tables 1 and 2)

使用設備

原文使用的感測器、運算硬體與載具(equipment)。型號保留原文寫法,連結到設備頁中同一型號的歸併名稱;角色依原文用途分為方法輸入、資料集感測器、執行運算平台、參考或真值量測(reference or ground truth)與比較對象設備。

原文使用的設備
類別型號(原文寫法)角色資料集原文規格出處
RGB-D 相機RealSense D435i歸入:Intel RealSense D435I方法輸入未標示depth quality described as slightly worse than Azure Kinect; two self-captured indoor room sequences, qualitative only(Wang et al., 2023a, Supp. 2.2; Supp. Figs. 12 and 13)
RGB-D 相機Azure Kinect資料集感測器NICE-SLAM apartment sequenceapartment sequence captured by the NICE-SLAM authors; run with the ScanNet setting, qualitative only(Wang et al., 2023a, Supp. 2.2; Supp. Fig. 11)
運算硬體Intel Core i7-12700K執行運算平台未標示3.60 GHz desktop CPU(Wang et al., 2023a, Sec. 4.1; Sec. 4.3)
運算硬體NVIDIA RTX 3090 Ti執行運算平台未標示desktop GPU used for all timings(Wang et al., 2023a, Sec. 4.1; Sec. 4.3)
其他motion capture system (model not reported)參考或真值量測TUM RGB-Dprovides TUM RGB-D ground-truth poses(Wang et al., 2023a, Sec. 4.1)

作者報告的優勢與限制

優勢

限制

營建工程相關證據

論文未涉及營建場域;定量評估使用 Replica、NeuralRGBD 合成資料、ScanNet 與 TUM RGB-D,另有以 RealSense D435i 自行拍攝的兩段室內房間序列與 NICE-SLAM 以 Azure Kinect 拍攝的公寓序列,但僅作定性比較。

原文驗證環境:模擬、公開基準

報告的性能數據

以下是原文作者報告的性能數值(author-reported results),不是本研究重新量測的結果。每張圖只並列同一個比較組(comparison group,同一張表、同一組實驗設定)內的方法;不同比較組之間的數值不可直接比較,也不構成排名。

本方法共出現在 29 個比較組,合計 133 筆紀錄。以下列出本方法紀錄最多的 4 組,其餘 25 組列在最後,並連到性能比較頁。

Wang et al., 2023a · Table 1 本方法 14 筆

表格設定(擷取紀錄原文):Averages over scenes; meshes culled with the authors' new culling strategy for all methods; TSDF-Fusion uses Co-SLAM poses; iMAP* is the NICE-SLAM re-implementation (Wang et al., 2023a, Table 1)

Depth L1 (cm),Replica (8 synthetic scenes) · average over scenes

只並列這張表在相同設定下報告的方法;以「本方法:」開頭者為本頁方法。失敗、未執行與未報告以標記呈現,不是 0。

按 Tab 進入圖表後,用上下方向鍵逐一瀏覽各類別,Esc 關閉提示框;也可開啟表格檢視閱讀全部數值。

這些是 Wang et al., 2023a 在此表設定下報告的數值(author-reported results),只能在同一個比較組內對照,不代表方法在其他資料或設定下的表現。

統計量:平均值(mean);對齊方式:不適用;單位:cm;場景:synthetic indoor

資料來源作者報告值(Wang et al., 2023a, Table 1)

數值與出處
方法(原文寫法)報告值出處
TSDF-Fusion6.36 cm(Wang et al., 2023a, Table 1)
iMAP4.64 cm(Wang et al., 2023a, Table 1)
NICE-SLAM1.9 cm(Wang et al., 2023a, Table 1)
Co-SLAM (Ours)本方法原文提出1.51 cm(Wang et al., 2023a, Table 1)

Wang et al., 2023a · Table 3 本方法 14 筆

指標ATE RMSE (cm), average of 5 runs

表格設定(擷取紀錄原文):ATE RMSE averaged over 5 runs; ground truth from BundleFusion; rigid alignment of trajectory (Supp. Sec. 2.3) (Wang et al., 2023a, Table 3)

ATE RMSE (cm), average of 5 runs,ScanNet · scene0000

只並列這張表在相同設定下報告的方法;以「本方法:」開頭者為本頁方法。失敗、未執行與未報告以標記呈現,不是 0。

按 Tab 進入圖表後,用上下方向鍵逐一瀏覽各類別,Esc 關閉提示框;也可開啟表格檢視閱讀全部數值。

這些是 Wang et al., 2023a 在此表設定下報告的數值(author-reported results),只能在同一個比較組內對照,不代表方法在其他資料或設定下的表現。

統計量:均方根誤差(RMSE);對齊方式:SE(3) 剛體對齊;單位:cm;場景:real indoor rooms

資料來源作者報告值(Wang et al., 2023a, Table 3)

數值與出處
方法(原文寫法)報告值出處
iMAP*55.95 cm(Wang et al., 2023a, Table 3)
NICE-SLAM8.64 cm(Wang et al., 2023a, Table 3)
Co-SLAM (Ours-dagger)本方法原文提出7.13 cm(Wang et al., 2023a, Table 3)
Co-SLAM (Ours)本方法原文提出7.18 cm(Wang et al., 2023a, Table 3)

Wang et al., 2023a · Table 2 本方法 12 筆

表格設定(擷取紀錄原文):Run-time as ms/iter x #iter; NICE-SLAM and iMAP* map every frame on TUM, otherwise mapping every 5 frames; Ours-dagger uses twice the tracking iterations (Wang et al., 2023a, Table 2)

FPS,ScanNet · scenes used in paper

只並列這張表在相同設定下報告的方法;以「本方法:」開頭者為本頁方法。失敗、未執行與未報告以標記呈現,不是 0。

按 Tab 進入圖表後,用上下方向鍵逐一瀏覽各類別,Esc 關閉提示框;也可開啟表格檢視閱讀全部數值。

這些是 Wang et al., 2023a 在此表設定下報告的數值(author-reported results),只能在同一個比較組內對照,不代表方法在其他資料或設定下的表現。

統計量:平均值(mean);對齊方式:不適用;單位:Hz;場景:real-world indoor sequences (ScanNet)

資料來源作者報告值(Wang et al., 2023a, Table 2)

數值與出處
方法(原文寫法)報告值出處
iMAP*硬體:not stated for baselines (the paper names the i7-12700K + RTX 3090ti desktop only for running Co-SLAM, Sec. 4.1)0.37 Hz(Wang et al., 2023a, Table 2)
NICE-SLAM硬體:not stated for baselines (the paper names the i7-12700K + RTX 3090ti desktop only for running Co-SLAM, Sec. 4.1)0.68 Hz(Wang et al., 2023a, Table 2)
Co-SLAM (Ours-dagger)本方法原文提出硬體:Intel Core i7-12700K + NVIDIA RTX 3090 Ti6.4 Hz(Wang et al., 2023a, Table 2)
Co-SLAM (Ours)本方法原文提出硬體:Intel Core i7-12700K + NVIDIA RTX 3090 Ti12.8 Hz(Wang et al., 2023a, Table 2)

Yan et al., 2024 · Table 1 本方法 9 筆

指標ATE RMSE [cm]

表格設定(擷取紀錄原文):Replica ATE RMSE, 8 scenes; * = reproduced with official code; methods in upper part run below 5 FPS (Yan et al., 2024, Table 1)

ATE RMSE [cm],Replica · Rm0

只並列這張表在相同設定下報告的方法;以「本方法:」開頭者為本頁方法。失敗、未執行與未報告以標記呈現,不是 0。

按 Tab 進入圖表後,用上下方向鍵逐一瀏覽各類別,Esc 關閉提示框;也可開啟表格檢視閱讀全部數值。

這些是 Yan et al., 2024 在此表設定下報告的數值(author-reported results),只能在同一個比較組內對照,不代表方法在其他資料或設定下的表現。

統計量:均方根誤差(RMSE);對齊方式:原文未報告;單位:cm;場景:synthetic indoor scenes

資料來源作者報告值(Yan et al., 2024, Table 1)

數值與出處
方法(原文寫法)報告值出處
Point-SLAM [ 27 ]0.56 cm(Yan et al., 2024, Table 1)
NICE-SLAM [ 55 ]0.97 cm(Yan et al., 2024, Table 1)
Vox-Fusion ∗ [ 48 ]1.37 cm(Yan et al., 2024, Table 1)
ESLAM [ 11 ]0.71 cm(Yan et al., 2024, Table 1)
CoSLAM [ 41 ]本方法0.7 cm(Yan et al., 2024, Table 1)
Ours原文提出0.48 cm(Yan et al., 2024, Table 1)

其他比較組

列出其餘 25 個比較組

來源

  • Wang et al., 2023a

    Hengyi Wang, Jingwen Wang, Lourdes Agapito(2023)Co-SLAM: Joint Coordinate and Sparse Parametric Encodings for Neural Real-Time SLAM2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 13293-13302

    同儕審查已出版已讀全文近十年

回到方法圖鑑

選擇開啟Esc關閉