First real-time RGB-D SLAM using a single MLP as the only map, trained live with keyframe replay and active pixel sampling.

技術屬性

欄位內容為文獻擷取紀錄的原文用語(英文),以原文為據;「未查證」表示本研究尚未讀到該資訊,不代表該方法不具備此能力。

iMAP 的技術屬性
感測輸入RGB-D (hand-held Microsoft Azure Kinect for real recordings; rendered Replica RGB-D sequences; TUM RGB-D sequences)
原文測試平台handheld
狀態估計Adam gradient descent: pose-only tracking against a frozen MLP; mapping jointly optimizes MLP weights and keyframe poses
資料關聯direct photometric (L1) + depth-variance-normalized geometric rendering losses on actively sampled pixels
時間表示discrete poses
去畸變不適用
迴圈閉合none
全域最佳化joint optimization over a bounded keyframe window (no loop closure)
地圖表示single MLP with Fourier-feature embedding (occupancy + colour)
先驗資訊none (trained live from scratch)
可輸出幾何mesh by marching cubes on queried occupancy (for visualization/evaluation only, not part of SLAM)
計算需求Python and PyTorch with multi-processing on a single desktop CPU and GPU (models not reported); default tracking 101 ms (6 iterations) and joint optimisation 448 ms (10 iterations) running concurrently on the same GPU, giving about 10 Hz tracking and 2 Hz mapping; 1.04 MB MLP (width 256) vs 67.10 MB for 256^3 TSDF fusion

使用設備

原文使用的感測器、運算硬體與載具(equipment)。型號保留原文寫法,連結到設備頁中同一型號的歸併名稱;角色依原文用途分為方法輸入、資料集感測器、執行運算平台、參考或真值量測(reference or ground truth)與比較對象設備。

原文使用的設備
類別型號(原文寫法)角色資料集原文規格出處
RGB-D 相機Microsoft Azure Kinect方法輸入未標示hand-held RGB-D camera; frames processed at 10 Hz in the experiments(Sucar et al., 2021, Fig. 1; Sec. 4.1)
運算硬體single desktop CPU and GPU (models not reported)執行運算平台未標示PyTorch; tracking and mapping run concurrently on the same GPU(Sucar et al., 2021, Sec. 1; Table 4)

作者報告的優勢與限制

優勢

限制

營建工程相關證據

論文未涉及營建場域;僅 Replica、TUM 與手持 Kinect 自錄場景。

原文驗證環境:模擬、公開基準、受控實驗

報告的性能數據

以下是原文作者報告的性能數值(author-reported results),不是本研究重新量測的結果。每張圖只並列同一個比較組(comparison group,同一張表、同一組實驗設定)內的方法;不同比較組之間的數值不可直接比較,也不構成排名。

本方法共出現在 33 個比較組,合計 229 筆紀錄。以下列出本方法紀錄最多的 4 組,其餘 29 組列在最後,並連到性能比較頁。

Sucar et al., 2021 · Table 1 本方法 27 筆

表格設定(擷取紀錄原文):Replica reconstruction from 200,000 points sampled on GT and reconstructed meshes; each scene reported at its highest reached completion ratio with the accuracy and completion at that point; TSDF fusion [4,17] uses iMAP camera tracking; meshes by marching cubes for evaluation only (Sucar et al., 2021, Table 1)

Acc. [cm],Replica · room-0

只並列這張表在相同設定下報告的方法;以「本方法:」開頭者為本頁方法。失敗、未執行與未報告以標記呈現,不是 0。

按 Tab 進入圖表後,用上下方向鍵逐一瀏覽各類別,Esc 關閉提示框;也可開啟表格檢視閱讀全部數值。

這些是 Sucar et al., 2021 在此表設定下報告的數值(author-reported results),只能在同一個比較組內對照,不代表方法在其他資料或設定下的表現。

統計量:平均值(mean);對齊方式:未對齊;單位:cm;場景:synthetic render of real indoor scan (Replica), 2000 RGB-D frames

資料來源作者報告值(Sucar et al., 2021, Table 1)

數值與出處
方法(原文寫法)報告值出處
iMAP本方法原文提出3.58 cm(Sucar et al., 2021, Table 1)
TSDF Fusion (with iMAP tracking)4.21 cm(Sucar et al., 2021, Table 1)

Yang et al., 2022 · Table 2 本方法 27 筆

表格設定(擷取紀錄原文):Replica mesh reconstruction; iMAP values from its paper, NICE-SLAM values from its supplementary without mesh culling (Yang et al., 2022, Table 2)

Acc. [cm],Replica · Room-0

只並列這張表在相同設定下報告的方法;以「本方法:」開頭者為本頁方法。失敗、未執行與未報告以標記呈現,不是 0。

按 Tab 進入圖表後,用上下方向鍵逐一瀏覽各類別,Esc 關閉提示框;也可開啟表格檢視閱讀全部數值。

這些是 Yang et al., 2022 在此表設定下報告的數值(author-reported results),只能在同一個比較組內對照,不代表方法在其他資料或設定下的表現。

統計量:平均值(mean);對齊方式:不適用;單位:cm;場景:synthetic indoor scenes

資料來源作者報告值(Yang et al., 2022, Table 2)

數值與出處
方法(原文寫法)報告值出處
iMap [ 31 ]本方法3.58 cm(Yang et al., 2022, Table 2)
NICE-SLAM [ 40 ]3.53 cm(Yang et al., 2022, Table 2)
Ours原文提出2.41 cm(Yang et al., 2022, Table 2)

Rosinol et al., 2023 · Table I 本方法 18 筆

表格設定(擷取紀錄原文):Replica rendered sequences (2000 frames per scene from iMAP); iMAP* and NICE-SLAM (GT depth) use rendered ground-truth depth; TSDF-Fusion, sigma-Fusion and NeRF-SLAM use DROID-SLAM poses and depths; Depth L1 is a proxy for geometric accuracy; values from the IROS 2023 version of record (the NeRF-SLAM row differs from arXiv v1) (Rosinol et al., 2023, Table I)

Depth L1 [cm],Replica · room-0

只並列這張表在相同設定下報告的方法;以「本方法:」開頭者為本頁方法。失敗、未執行與未報告以標記呈現,不是 0。

按 Tab 進入圖表後,用上下方向鍵逐一瀏覽各類別,Esc 關閉提示框;也可開啟表格檢視閱讀全部數值。

這些是 Rosinol et al., 2023 在此表設定下報告的數值(author-reported results),只能在同一個比較組內對照,不代表方法在其他資料或設定下的表現。

統計量:原文未報告;對齊方式:不適用;單位:cm;場景:synthetic renders of scanned indoor scenes

資料來源作者報告值(Rosinol et al., 2023, Table I)

數值與出處
方法(原文寫法)報告值出處
iMAP* [27] (GT depth)本方法5.7 cm(Rosinol et al., 2023, Table I)
Nice-SLAM [28] (GT depth)2.53 cm(Rosinol et al., 2023, Table I)
TSDF-Fusion Res. = 256 (our depth)23.51 cm(Rosinol et al., 2023, Table I)
sigma-Fusion [15] Res. = 256 (our depth)21.92 cm(Rosinol et al., 2023, Table I)
Nice-SLAM [28] (no depth)11.12 cm(Rosinol et al., 2023, Table I)
Ours (our depth)原文提出8.11 cm(Rosinol et al., 2023, Table I)

Wang et al., 2023a · Table 1 本方法 14 筆

表格設定(擷取紀錄原文):Averages over scenes; meshes culled with the authors' new culling strategy for all methods; TSDF-Fusion uses Co-SLAM poses; iMAP* is the NICE-SLAM re-implementation (Wang et al., 2023a, Table 1)

Depth L1 (cm),Replica (8 synthetic scenes) · average over scenes

只並列這張表在相同設定下報告的方法;以「本方法:」開頭者為本頁方法。失敗、未執行與未報告以標記呈現,不是 0。

按 Tab 進入圖表後,用上下方向鍵逐一瀏覽各類別,Esc 關閉提示框;也可開啟表格檢視閱讀全部數值。

這些是 Wang et al., 2023a 在此表設定下報告的數值(author-reported results),只能在同一個比較組內對照,不代表方法在其他資料或設定下的表現。

統計量:平均值(mean);對齊方式:不適用;單位:cm;場景:synthetic indoor

資料來源作者報告值(Wang et al., 2023a, Table 1)

數值與出處
方法(原文寫法)報告值出處
TSDF-Fusion6.36 cm(Wang et al., 2023a, Table 1)
iMAP本方法4.64 cm(Wang et al., 2023a, Table 1)
NICE-SLAM1.9 cm(Wang et al., 2023a, Table 1)
Co-SLAM (Ours)原文提出1.51 cm(Wang et al., 2023a, Table 1)

其他比較組

列出其餘 29 個比較組

來源

  • Sucar et al., 2021

    Edgar Sucar, Shikun Liu, Joseph Ortiz, Andrew J. Davison(2021)iMAP: Implicit Mapping and Positioning in Real-Time2021 IEEE/CVF International Conference on Computer Vision (ICCV), pp. 6209-6218

    同儕審查已出版已讀全文近十年

回到方法圖鑑

選擇開啟Esc關閉