狀態估計與迴圈閉合
SLAM 後端把大量相對量測整合成一組彼此一致的位姿,迴圈閉合與外部先驗則提供修正累積漂移的全域約束。本頁整理濾波、平滑與因子圖的差異、當代 LiDAR(慣性)系統實際採用的估計器,以及迴圈修正之後點雲地圖究竟如何被更新,並標出營建場域仍欠缺的證據。
本頁內容
先說結論,細節與出處見各節:
- 多數估計後端最佳化的是位姿(有時含地標),不是點雲本身。g2o 這類框架只輸出最佳化後的變數,不維護稠密地圖 (Kümmerle et al., 2011);迴圈修正能否改善點雲,取決於地圖是否依新位姿重建、變形或精修。
- 濾波與平滑的差別在於保留哪些過去狀態、能否對過去狀態重新線性化,而不是固定的優劣;即使是常被引用的比較,結論也附帶模擬與場景條件 (Strasdat et al., 2012, Sec. 7)。
- 場所辨識只提出候選。單一未被剔除的錯誤迴圈,就可能讓局部仍一致的地圖整體扭曲 (Sünderhauf & Protzel, 2012, Sec. IV-D1)。
- 本研究讀過的文獻中,沒有一篇在施工現場以獨立參考量測,量化迴圈修正前後點雲的構件層級誤差。
估計問題:從隨機地圖到因子圖
聯合估計與相關性
SLAM 要同時估計載具軌跡與環境。Smith、Self 與 Cheeseman 提出的隨機地圖(stochastic map),把機器人與各物件之間的空間關係排成一個狀態向量,同時保存平均值與完整的共變異數(covariance)矩陣,並以一階線性化傳遞位姿複合的不確定度 (Smith et al., 1990, Sec. 2 至 3)。Durrant-Whyte 與 Bailey 的教學文回顧指出,地標估計因共用同一個車輛位置誤差而必然彼此相關,因此一致的完整解必須聯合估計車輛與所有地標 (Durrant-Whyte & Bailey, 2006, Sec. II)。
車輛狀態 與 N 個地標 共用一個共變異數矩陣;非對角區塊 就是上述的相關性。
擴展卡爾曼濾波與粒子濾波
擴展卡爾曼濾波(extended Kalman filter, EKF)形式的 SLAM 有明確的理論性質。Dissanayake 等人在線性、同步的離散時間模型下證明,相對地圖不確定度單調下降,地標估計在極限下完全相關;省略地標之間的交互相關,會導致不一致與發散 (Dissanayake et al., 2001, Sec. III, V)。代價是運算與地圖儲存量都隨地標數 N 以 N² 成長 (Dissanayake et al., 2001, Sec. V)。Durrant-Whyte 與 Bailey 也提醒,這些收斂結果只在線性高斯情形下得證 (Durrant-Whyte & Bailey, 2006, Sec. III.C, IV.A)。
同一篇教學文把 FastSLAM 所代表的 Rao-Blackwellized 粒子濾波(particle filter)列為與 EKF-SLAM 並列的另一類解法 (Durrant-Whyte & Bailey, 2006, Sec. IV)。Stachniss 等人的手冊章節比較三種典範:EKF 受規模與線性化不一致所限,粒子法在多重巢狀迴圈時所需粒子數可能很大,圖式方法則因有高效的稀疏最佳化而成為大尺度建圖的主流選擇 (Stachniss et al., 2016, Sec. 46.2.4)。
位姿圖與因子圖
圖式路線可追溯到 Lu 與 Milios:每幅掃描以取得時的位姿為局部座標,掃描匹配與里程計分別提供強、弱兩種相對位姿約束,再以最大概似準則同時求解所有位姿 (Lu & Milios, 1997, Sec. 2)。Cadena 等人明言,現行事實標準的最大後驗(maximum a posteriori, MAP)後端形式源自此文 (Cadena et al., 2016, Sec. II)。Grisetti 等人的教學文把問題寫成位姿圖(pose graph):節點是不同時刻的位姿,邊是里程計或重訪同一區域得到的相對約束,後端求出最符合所有約束的節點配置 (Grisetti et al., 2010, Sec. IV)。
是第 k 個約束的殘差, 是其資訊矩陣(information matrix),即共變異數的反矩陣。g2o 把位姿圖、地標 SLAM 與光束法平差(bundle adjustment, BA)都寫成這種以資訊矩陣加權的最小平方問題,以 Gauss-Newton 或 Levenberg-Marquardt 迭代,並在流形上以最小參數化更新旋轉 (Kümmerle et al., 2011, Sec. III)。
更一般的因子圖(factor graph)把每個量測寫成只連接少數變數的因子;Dellaert 與 Kaess 的專書說明,非線性因子圖的 MAP 推論可化為反覆求解大型稀疏線性系統,計算量由變數消去順序與填充決定 (Dellaert & Kaess, 2017)。
Cadena 等人把 SLAM 系統分成前端(front-end)與後端(back-end):前端把感測資料抽象成可估計的模型並做資料關聯,後端在因子圖上做 MAP 推論 (Cadena et al., 2016, Sec. II)。Grisetti 等人的教學文明示假設前端提供一致的約束,不處理穩健資料關聯 (Grisetti et al., 2010, Sec. IV)。這個分工決定了錯誤迴圈的風險落在哪一端(見錯誤迴圈與穩健後端)。
濾波、平滑與兩者之間
本站把估計後端粗分為三條路線:濾波(filtering)、平滑(smoothing)與因子圖,以及連續時間估計。這是審閱者的整理,不是單一文獻的主張,三者之間的界線也不是絕對的。
濾波:只保留現在
濾波在每一步把過去的狀態邊際化(marginalization),只留下目前狀態與其不確定度。Mourikis 與 Roumeliotis 用於視覺輔助慣性導航的多狀態約束卡爾曼濾波(multi-state constraint Kalman filter, MSCKF)是一個保留少量過去狀態的變形:靜態特徵被多個相機位姿觀測時,直接以這些位姿間的幾何約束更新濾波器,不把三維特徵放進狀態,因此計算量對特徵數為線性;狀態中只保留有限數量的過去相機位姿副本 (Mourikis & Roumeliotis, 2007, Sec. III)。
迭代擴展卡爾曼濾波(iterated EKF, IEKF)把濾波與最佳化連起來。Bell 與 Cathey 證明,迭代卡爾曼濾波的量測更新步驟就是以 Gauss-Newton 法近似最大概似估計,只迭代一次時即為 EKF 更新 (Bell & Cathey, 1993, Sec. III 至 VI);在其雙站測距例子中,觀測越精確時 IKF 更新會收斂到真值,EKF 更新則收斂到有偏的值,誤差共變異數卻趨近於零 (Bell & Cathey, 1993, Sec. VII)。Barfoot 則指出,IEKF 的估計對應完整後驗的局部最大值(MAP),但這個對應只成立於單一時間步的修正步驟 (Barfoot, 2017, Sec. 4.2.6)。IKFoM 把迭代誤差狀態 EKF 建構在流形上並做成 C++ 工具包;期刊版以兩個緊耦合 LiDAR 與慣性融合系統驗證:以 IKFoM 重新實作 FAST-LIO 並加入線上外參估計,六組資料的漂移與手推版本相當、執行時間略增;以 IKFoM 取代 LINS 的手推濾波器,執行時間則較短 (He et al., 2023b, Sec. IV, Tables I 至 III);FAST-LIO2 的狀態估計即沿用這套流形上的迭代卡爾曼濾波 (Xu et al., 2022, Sec. IV)。
平滑與增量平滑:保留整條軌跡
Kaess 等人指出,平滑保留整條軌跡,使資訊矩陣維持自然稀疏;濾波在邊際化位姿時則會讓它變稠密 (Kaess et al., 2008, Sec. I)。iSAM 以增量更新平方根資訊矩陣的方式只重算受新量測影響的部分,遇到迴圈造成填充時再週期性重排序並重新分解 (Kaess et al., 2008, Sec. IV-A)。iSAM2 以 Bayes tree 只重新消去受影響的部分,並以「流動式重線性化」只在變數增量超過門檻時更新線性化點,因而不再需要週期性批次步驟 (Kaess et al., 2012, Sec. 3 至 4);但作者也指出,更新步驟並非常數時間,大型迴圈閉合的成本可能與批次解相當 (Kaess et al., 2012, Related work)。
g2o 與 GTSAM 是通用的最佳化函式庫。g2o 以批次 Gauss-Newton 或 Levenberg-Marquardt 求解,並假設有良好的初值 (Kümmerle et al., 2011, Sec. III-A);GTSAM 以因子圖與 Bayes network 為運算範式,同時提供批次最佳化與 iSAM2 (Dellaert & GTSAM Contributors, 2026)。
兩者之間:滑動視窗與固定延遲平滑
滑動視窗(sliding window)只保留最近一段時間的狀態。Sibley 等人指出,同一架構在視窗涵蓋全部時間時等同完整 BA,只保留一個時間步時等同 EKF (Sibley et al., 2010, Abstract; Sec. 3);其實驗也顯示,一或兩個影格的短視窗會過早邊際化而鎖住線性化誤差並可能發散,10 個影格的視窗則未出現此問題 (Sibley et al., 2010, Sec. 4, Fig. 15);作者並指出,邊際化使舊地標難以重新觀測,實際上排除了迴圈閉合 (Sibley et al., 2010, Sec. 4)。Dellaert 與 Kaess 把固定延遲平滑(fixed-lag smoothing)描述為交替進行量測更新與邊際化最舊狀態,並把固定延遲平滑與濾波都視為在因子圖上邊際化舊狀態的情形 (Dellaert & Kaess, 2017, Sec. 5.3.2)。LiDAR 系統中,GLIM 的里程計以數秒的固定延遲視窗持續修正過去狀態(圖示配置為 5 s) (Koide et al., 2024, Sec. IV-B),LiLi-OM 則以關鍵影格滑動視窗融合 LiDAR 與 IMU 預積分並邊際化舊狀態 (Li et al., 2021b, Sec. 2)。
- 位姿變數
- 已邊際化的位姿
- 里程計因子
- 先驗因子
- 迴圈因子
觀察重點:切換三種形式,看哪些位姿仍是可被調整的變數。濾波只保留最新狀態,較早的資訊被邊際化成一個先驗;滑動視窗保留最近幾個狀態;完整平滑保留整條軌跡,因此回到 x₁ 的迴圈約束可以直接成為因子,修正也能分攤到中間各位姿。Dellaert 與 Kaess 把固定延遲平滑與濾波描述為在因子圖上邊際化舊狀態 (Dellaert & Kaess, 2017, Sec. 5.3.2);Sibley 等人指出,滑動視窗涵蓋全部時間時等同完整 BA,只保留一個時間步時等同 EKF (Sibley et al., 2010, Abstract; Sec. 3),也說明邊際化使舊地標難以重新觀測,實際上排除了迴圈閉合 (Sibley et al., 2010, Sec. 4)。
簡化條件:只畫位姿與里程計因子,省略地標、速度與 IMU 偏差。「無法加入」只針對已被邊際化的位姿:若地標仍留在濾波狀態中(如 EKF-SLAM 的隨機地圖),重新觀測舊地標仍可作為約束,經由相關性降低機器人與所有相關物件的不確定度 (Smith et al., 1990, Sec. 2.3)。有地標時,Kaess 等人也指出濾波在邊際化位姿時會使資訊矩陣變稠密,平滑則維持自然稀疏 (Kaess et al., 2008, Sec. I)。實際系統常以另一個位姿圖或 BA 模組處理迴圈,例如 Voxel-SLAM 的里程計只更新目前狀態(IMU 傳播後對體素地圖做掃描對地圖配準),迴圈則交由位姿圖最佳化與階層式 BA 做全域修正 (Liu et al., 2026, Sec. 6.1, 8.2, 9(期刊版));本圖不代表任何系統的實作。
誰比較準?條件比結論重要
Strasdat 等人以蒙地卡羅模擬比較即時視覺 SLAM 的濾波與關鍵影格 BA;其濾波實作是資訊形式的 Gauss-Newton 濾波(迭代 EKF 的對偶形式),並未實作一般 EKF,單眼與雙眼相機也都是模擬 (Strasdat et al., 2012, Sec. 4.2, 5.3 至 5.4, 6)。在假設資料關聯已知、刻意不含大尺度 SLAM 與迴圈閉合的條件下,他們的結論是關鍵影格 BA 每單位計算時間的精度最高;但他們也指出,在中等難度設定中濾波可達 BA 的精度,此時優勢主要來自成本(BA 成本對觀測數為線性,濾波更新對觀測數為三次方) (Strasdat et al., 2012, Sec. 6.4 至 6.5, 7 至 8)。
IMU 預積分
IMU 預積分(IMU preintegration)把兩個關鍵影格之間的大量 IMU 量測預先積分成單一相對運動約束。Forster 等人在 SO(3) 流形上推導預積分、雜訊傳播與偏差的事後修正,並把預積分因子放入以 iSAM2 增量平滑的因子圖 (Forster et al., 2017a, Sec. I);Forster 等人與 GTSAM 文件都把預積分概念歸於 Lupton 與 Sukkarieh (Forster et al., 2017a; Dellaert & GTSAM Contributors, 2026),後者的原始工作見 (Lupton & Sukkarieh, 2012)。LIO-SAM 把 IMU 預積分因子與 LiDAR 里程計、GNSS、迴圈因子放在同一張 iSAM2 因子圖中 (Shan et al., 2020, Sec. III)。
連續時間估計
Talbot 等人的綜述指出,離散時間方法常把旋轉式 LiDAR 點、IMU 等高頻量測聚合成低頻擬量測並以去畸變修正,而去畸變本質上是需要先知道運動才能修正的雞生蛋問題,會引入難以建模的誤差;連續時間(continuous-time)表示則可在任意時間查詢狀態 (Talbot et al., 2025, Sec. I)。作者同時指出,這類方法的基準比較經常不一致,只看彙總的絕對軌跡誤差(absolute trajectory error, ATE)或相對位姿誤差(relative pose error, RPE)並不充分 (Talbot et al., 2025, Sec. V-C)。Barfoot 等人把批次軌跡估計寫成以時間為自變數的高斯過程迴歸,並證明當先驗由白雜訊驅動的線性時變隨機微分方程定義(例如等速度模型)時,其逆核為精確稀疏的區塊三對角結構,因而可高效求解並內插查詢任意時間的狀態 (Barfoot et al., 2014, Sec. III);這個稀疏性要求狀態取馬可夫形式,例如等速度先驗須把位置與速度一起放進狀態,若邊際化速度,逆核就會變稠密 (Barfoot et al., 2014, Sec. III-D, V)。
Cioffi 等人比較視覺慣性 SLAM 的兩種表示:相機與 IMU 已時間同步時,連續與離散時間結果相近;兩條量測串流存在延遲時,連續時間表示較能估計時間偏移 (Cioffi et al., 2022, Sec. V)。此證據只來自視覺慣性與離線全批次最佳化,未涉及 LiDAR 點雲幾何。掃描內運動畸變與去畸變的細節見一個點如何落到地圖上。
當代 LiDAR(慣性)系統的後端
下表只整理各系統原文所述的估計器與全域修正方式。它說明「怎麼做」,不是準確度比較;系統名稱連到方法圖鑑的詳細欄位。
| 系統 | 範圍 | 估計器 | 全域修正 | 出處 |
|---|---|---|---|---|
| LOAM | 里程計+局部建圖 | Levenberg-Marquardt 非線性最小平方;約 10 Hz 掃描對掃描里程計與約 1 Hz 掃描對地圖建圖並行 | 無迴圈閉合(作者列為未來工作) | (Zhang & Singh, 2014, Sec. I, IV 至 VI, VIII) |
| LeGO-LOAM | 具全域修正的完整 SLAM | 兩步驟 Levenberg-Marquardt:地面特徵求 z、roll、pitch,邊緣特徵求 x、y、yaw | 可選:以 ICP 建立迴圈約束並以 iSAM2 最佳化位姿圖;原文只在 KITTI 00 測試中啟用 | (Shan & Englot, 2018, Sec. III-D, III-E, IV-D) |
| LIO-SAM | 具全域修正的完整 SLAM | iSAM2 增量因子圖:IMU 預積分、LiDAR 里程計、GNSS 與迴圈四種因子 | 15 m 內以歐氏距離找候選,掃描配準後加入迴圈因子 | (Shan et al., 2020, Sec. III) |
| LiLi-OM | 具全域修正的完整 SLAM | 關鍵影格滑動視窗最佳化(含邊際化,Ceres)融合 LiDAR 特徵與 IMU 預積分 | 半徑搜尋候選、ICP 分數驗證後,以 GTSAM 最佳化全域位姿圖 | (Li et al., 2021b, Sec. 2, 4) |
| FAST-LIO2 | 里程計+局部建圖 | 流形上的迭代卡爾曼濾波(沿用 FAST-LIO 與 IKFoM),狀態含 LiDAR 與 IMU 之間的外參 | 無;作者明言為不含迴圈偵測與修正的里程計 | (Xu et al., 2022, Sec. IV, VI-C) |
| Faster-LIO | 里程計+局部建圖 | 沿用 FAST-LIO2 的迭代 EKF,地圖改以增量稀疏體素(iVox)管理 | 無(作者自述) | (Bai et al., 2022, Sec. III, V-C) |
| DLIO | 里程計+局部建圖 | 非線性幾何觀測器(既非卡爾曼濾波,也非因子圖),以 GICP 掃描對地圖結果更新 | 無(列為未來工作) | (Chen et al., 2023, Sec. III, V) |
| SuMa | 具全域修正的完整 SLAM | 投影式資料關聯的點到面 frame-to-model ICP(Gauss-Newton) | 候選以 ICP 與虛擬視圖一致性驗證,位姿圖以 gtsam 在獨立執行緒最佳化 | (Behley & Stachniss, 2018, Sec. III-C, III-E, III-F) |
| MULLS | 具全域修正的完整 SLAM | 多度量線性最小平方 ICP(點到點、點到面、點到線) | 子地圖間以 TEASER 全域配準與 MULLS-ICP 精修建立迴圈邊,再做階層式位姿圖 | (Pan et al., 2021, Sec. III-C, III-E) |
| CT-ICP | 具全域修正的完整 SLAM | 每次掃描以起訖兩個位姿表示的連續時間掃描對地圖 ICP | 高程影像偵測迴圈,偵測到迴圈時才以 g2o 最佳化位姿圖;假設大致平面運動 | (Dellenbach et al., 2022, Sec. III 至 IV) |
| GLIM | 具全域修正的完整 SLAM | 固定延遲平滑(GTSAM 的 iSAM2),GPU 體素化 GICP 配準誤差因子與 IMU 預積分 | 以子地圖之間的配準誤差因子做全域最佳化,而非顯式場所辨識 | (Koide et al., 2024, Sec. I, IV-B) |
| KISS-SLAM | 具全域修正的完整 SLAM | KISS-ICP 點到點 ICP 里程計 | 鳥瞰密度影像與 ORB 描述子找候選、重疊率超過 40% 才接受;局部地圖關鍵位姿的位姿圖,最後做離線細粒度位姿圖 | (Guadagnino et al., 2025a, Sec. III) |
| Voxel-SLAM | 具全域修正的完整 SLAM | 里程計以 IMU 傳播與運動補償後,依 VoxelMap 的做法對自適應體素地圖做掃描對地圖配準(點到平面距離含逐點雜訊,加上 IMU 殘差)更新目前狀態;初始化中的粗略 LIO 則沿用 FAST-LIO;局部建圖為滑動視窗(10 幀)的 LiDAR 與慣性融合 BA,結合 BALM2 點簇因子與 IMU 預積分 | BTC 描述子加平面與漂移比例檢查;漂移超過門檻時以 GTSAM 做位姿圖最佳化並重建體素地圖;階層式全域 BA 在即時階段做關鍵影格視窗 BA,作業結束後再做子地圖層級的全域 BA | (Liu et al., 2026, Sec. 4 至 9(期刊版)) |
幾個設計細節會直接影響點雲。LIO-SAM 在位姿變化超過 1 m 或 10° 時加入關鍵影格,新關鍵影格只與近期 25 個子關鍵影格組成的局部體素地圖配準 (Shan et al., 2020, Sec. III-A, III-C);作者也說明,沒有絕對量測或迴圈時,LiDAR 與慣性融合的里程計仍會長時間漂移 (Shan et al., 2020, Sec. III-D, V)。LIO-SAM 作者認為 LOAM 以全域體素地圖儲存,使迴圈閉合與 GPS 等絕對量測難以加入 (Shan et al., 2020, Sec. I)。
在較極端的場域,Ebadi 等人回顧參加 DARPA SubT 系統組的六支隊伍:前端多先做去畸變與體素濾波,再以類 LOAM 的特徵匹配或 ICP 類密集配準估計里程計,後端多採因子圖或位姿圖最佳化,且多數隊伍採鬆耦合融合 (Ebadi et al., 2024, Sec. III-H);也有隊伍不偵測迴圈(CTU-CRAS-Norlab,以及 CERBERUS 的機載系統) (Ebadi et al., 2024, Sec. III-B-3, III-E-2, III-E-3, III-H-2)。
元件、系統、表示不要混為一談
同一個名稱可能指一個函式庫、一個里程計、一套完整 SLAM,或一個離線精修工具。比較或引用前先確認層級,否則容易把「函式庫支援迴圈因子」誤讀成「系統會偵測迴圈」,或把里程計的漂移當成完整 SLAM 的限制。分類依本研究擷取紀錄的系統範圍欄位;同一系統可同時扮演多種角色,例如 BALM 在原文中是 LOAM 架構的後端局部精修 (Liu & Zhang, 2021, Sec. V)。
「沒有迴圈閉合的 SLAM 即退化為里程計」出自 Cadena 等人 (Cadena et al., 2016, Sec. I)。地圖表示(點、體素、面元、TSDF、網格等)是另一個獨立的維度,見地圖表示。
迴圈閉合:候選、驗證、約束
Cadena 等人指出,捨棄迴圈閉合(loop closure)的 SLAM 即退化為里程計 (Cadena et al., 2016, Sec. I)。本站把迴圈處理拆成四步來閱讀各系統(本站整理):
- 候選:以位置鄰近或場所辨識(place recognition)描述子,找出可能重訪的掃描或子地圖。
- 驗證:以配準、重疊率或幾何檢查確認候選為真。
- 約束:把驗證後的相對位姿與其權重加入位姿圖或因子圖。
- 最佳化與地圖更新:後端重新求解,地圖再依新位姿更新(見迴圈修正對點雲做了什麼)。
以位置找候選
LIO-SAM 在 15 m 內以歐氏距離搜尋候選,再把新關鍵影格與候選前後 ±12 個子關鍵影格做掃描配準,加入迴圈因子;作者說明也可改用描述子式的場所辨識 (Shan et al., 2020, Sec. III-E)。OverlapNet 以傳播後的位姿共變異數與 Mahalanobis 距離決定搜尋範圍,取代固定半徑 (Chen et al., 2020, Sec. III-F)。2D 的 Cartographer 則把所有完成的子地圖都列為候選,以分支定界加速的掃描匹配讓迴圈約束能即時計算 (Hess et al., 2016, Sec. V)。
以描述子找候選
Scan Context 以感測器為中心,把單次掃描劃分為 20 環乘 60 扇區的極座標格網(最大距離 80 m),每格記錄點的最大高度,作為不需直方圖或事前訓練的全域描述子(descriptor);先以環鍵的 kd-tree 取出候選,再比較所有欄位平移下的距離,因此可偵測反向重訪,平移量也給出約 6° 解析度的偏航初值供 ICP 使用 (Kim & Kim, 2018, Sec. III-A 至 III-C, IV-C)。Scan Context++ 再分出處理航向旋轉的 Polar Context 與處理側向平移的 Cart Context,依序以檢索鍵找候選、以對齊鍵做 1 自由度對齊、以完整描述子剔除誤判,並假設橫滾與俯仰變化不劇烈 (Kim et al., 2022b, Abstract; Sec. IV 至 V);以 ±5° 至 ±15° 的隨機橫滾與俯仰預旋轉模擬時,各受測描述子的效能都明顯下降 (Kim et al., 2022b, Sec. VIII-D, Fig. 20)。作者在 MulRan Sejong 相隔兩個月的時段間示範跨時段辨識 (Kim et al., 2022b, Sec. VII-D)。
STD 在累積數幀的關鍵影格上,從平面邊界取關鍵點組成三角形描述子,以雜湊表檢索,再以 RANSAC 與平面幾何驗證得到相對位姿,並支援非重複掃描的固態 LiDAR (Yuan et al., 2023b, Sec. III)。學習式方法依賴訓練資料:OverlapNet 以孿生網路預測兩次掃描的重疊率與相對偏航角,只以 KITTI 訓練並在 Ford Campus 測試 (Chen et al., 2020, Sec. IV);PointNetVLAD 需要以 GPS/INS 參考的子地圖監督訓練 (Uy & Lee, 2018, Sec. 5.1)。KISS-SLAM 把地面對齊後的局部地圖投影成鳥瞰密度影像,以 ORB 描述子比對 (Guadagnino et al., 2025a, Sec. III-C)。
驗證關卡
各系統都在加入約束前設下檢查。KISS-SLAM 要求 3D 配準後的重疊率超過 40% (Guadagnino et al., 2025a, Sec. III-C);SuMa 以合成的虛擬視圖檢驗一致性,並在後續多幀持續驗證 (Behley & Stachniss, 2018, Sec. III-E);Voxel-SLAM 除描述子與幾何驗證外,還要求平面約束涵蓋三個獨立方向,且漂移與行進距離之比夠小(例如不超過 1%) (Liu et al., 2026, Sec. VIII-A(arXiv v1))。CT-ICP 的迴圈偵測則假設運動大致在平面上,且 z 軸與地面法向一致 (Dellenbach et al., 2022, Sec. IV)。
失效情境與評估差異
與走廊狀或重複結構相關的失效,多由作者或後續研究自行報告。Scan Context 原作者指出,在含狹窄室內空間的 NCLT 路段,因垂直高度變化小,召回率與精確率偏低 (Kim & Kim, 2018, Sec. IV-B)。STD 作者在多樓層建築室內資料中,因各樓層走廊相似,精確率與召回率低於其他場景,但作者認為仍能提供一定數量的有效迴圈 (Yuan et al., 2023b, Sec. IV-B1)。Yang 等人報告,LT-SLAM 在重複的室內停車場因 Scan Context 無法辨識迴圈而失敗 (Yang et al., 2024, Sec. IV-B)。Scan Context++ 的失效案例來自車載資料中沿走廊狀場所行駛,以及公車等高大物體緊貼感測器 (Kim et al., 2022b, Sec. VIII-F);作者認為方法最適合都市結構環境,室內與自然環境可能需要強度或語意等額外通道 (Kim et al., 2022b, Sec. VIII-H3)。
評估方式也不一致。Yin 等人的綜述指出,場所辨識論文採用的成功門檻不同(例如 25 m 與 3 m),妨礙跨論文比較;光達型號或安裝的 roll、pitch 改變,可使最先進的全域定位方法失效,累積子地圖可減輕這個問題 (Yin et al., 2024, Sec. 6.1, 6.6)。
錯誤迴圈與穩健後端
在平方誤差下,殘差越大的約束對解的拉力越大,一條錯誤迴圈就可能把整張圖拉離正確解。Cadena 等人指出,常以 Huber 或 Tukey 等穩健損失函數(robust loss function)取代平方誤差,以提高對離群值的承受力 (Cadena et al., 2016, Sec. II):
Sünderhauf 與 Protzel 的切換約束(switchable constraints)為每條可能出錯的迴圈約束加入一個切換變數,以介於 0 與 1 的切換函數縮放其權重,並以切換先驗把它錨定在初始值 1,讓位姿圖的拓樸本身成為最佳化對象 (Sünderhauf & Protzel, 2012, Sec. II)。在四個資料集加入 0 至 1000 條錯誤迴圈的 2500 次試驗中,只有兩次未收斂到正確解 (Sünderhauf & Protzel, 2012, Sec. IV-B, Table II)。
同一篇論文也記錄了失效。在 3D 多層停車場資料中,樓層之間只由兩段里程計相連,樓層間的錯誤迴圈沒有被停用,結果遭到破壞 (Sünderhauf & Protzel, 2012, Sec. IV-D2);另有兩個案例中,單一未偵測的錯誤迴圈讓局部仍一致的地圖整體扭曲,作者以結合 Huber 成本解決 (Sünderhauf & Protzel, 2012, Sec. IV-D1),但也指出 Huber 成本的部分線性會減慢收斂 (Sünderhauf & Protzel, 2012, Sec. IV-B)。切換先驗的變異數無法解析推得,須經驗設定 (Sünderhauf & Protzel, 2012, Sec. IV-A)。
Yang 等人把穩健估計中的「Black 與 Rangarajan 對偶」與漸進非凸化(graduated non-convexity, GNC)結合,交替進行加權最小平方求解與權重的封閉解更新,不需初始猜測;作者報告在其測試問題中可承受約 70% 至 80% 的離群值 (Yang et al., 2020b, Sec. V),並把保證收斂的條件列為未來工作 (Yang et al., 2020b, Sec. VI)。其配準、位姿圖與形狀對齊實驗的離群值都是人工注入,位姿圖測試中的離群迴圈是隨機產生的 (Yang et al., 2020b, Sec. V-A 至 V-C)。
系統層級也採用這些機制:maplab 2.0 把光達與視覺迴圈邊設為可切換約束 (Cramariuc et al., 2023, Sec. III-A, III-D);Kimera-Multi 以分散式 GNC 剔除感知混淆造成的錯誤跨機迴圈 (Tian et al., 2022, Sec. III),但在跨機迴圈很少的 Stata 資料中,分散式 GNC 預設的近似變數更新把機器人 2 唯一的跨機迴圈剔除,使其軌跡錯位,需 2000 次迭代(約 14 分鐘)才正確對齊 (Tian et al., 2022, Sec. VII-C, Fig. 14);LEMON-Mapping 先剔除離群迴圈,再於第一次位姿圖最佳化後召回位姿相距 2 m 內的被剔除迴圈 (Wang et al., 2026, Sec. IV, VI-B)。
迴圈修正對點雲做了什麼
位姿圖與因子圖後端最佳化的對象是位姿(有時含地標),不是點雲。g2o 的輸出是最佳化後的位姿與地標,不含稠密地圖 (Kümmerle et al., 2011)。Grisetti 等人指出,無論採何種表示,地圖都由量測及其取得的位置決定 (Grisetti et al., 2010, Sec. II);其 Intel Research Lab 例子展示的是最佳化後的位姿圖與由此得到的一致地圖 (Grisetti et al., 2010, Sec. V-A, Fig. 9)。因此「迴圈修正讓點雲變好」有一個前提:地圖必須跟著修正後的位姿重建、變形或精修。下面的互動圖以 2D 平面圖示範這個前提。
- 參考牆面(真值)
- 前半圈掃描點
- 後半圈掃描點
- 估計軌跡
- 真實軌跡
觀察重點:先只看里程計:偏差讓航向逐步累積,前半圈(青)與後半圈(橙)的點落在同一面牆的不同位置,牆變厚、出現重影。按「執行因子圖最佳化」後,迴圈約束把誤差分攤回整條軌跡,點雲重新貼合牆面。再取消迴圈約束比較:沒有全域約束時,最佳化無法修正累積漂移。
簡化條件:2D 平面、已知且正確的迴圈對應、里程計與迴圈權重固定;實際系統的迴圈偵測可能錯誤,且修正後的點雲需依更新位姿重新組合。「點到牆 RMS」是本模擬用的示意指標,並非標準化的點雲品質指標。
已讀文獻中,迴圈修正後更新地圖的方式至少有下列幾種:
| 更新方式 | 紀錄中的做法 | 對點雲的直接影響 |
|---|---|---|
| 依最佳化後位姿重組掃描或關鍵影格 | Lu 與 Milios 的地圖即附著於各位姿的掃描集合;LIO-SAM 的全域特徵地圖由關鍵影格的邊緣與平面特徵點雲及關鍵影格軌跡組成,關鍵影格(位姿變化 1 m 或 10°)之間的掃描則被捨棄;g2o 只輸出位姿與地標,稠密點雲須由使用者依新位姿重新投影。 (Lu & Milios, 1997; Shan et al., 2020; Kümmerle et al., 2011) | 每幅掃描或關鍵影格整體剛體移動(推論)。 |
| 地圖元素綁定建立時的位姿 | SuMa 的面元綁定建立時的位姿,位姿圖最佳化後不需重新融合即可更新地圖。 (Behley & Stachniss, 2018) | 面元隨所屬位姿移動,不需重新融合(作者所述)。 |
| 局部地圖錨定於關鍵位姿,再離線細修 | KISS-SLAM 的位姿圖只最佳化局部地圖的關鍵位姿;處理完成後再以離線細粒度位姿圖把殘餘漂移分配到局部軌跡。 (Guadagnino et al., 2025a) | 線上修正以局部地圖為單位,局部地圖內部的漂移留待離線步驟。 |
| 非剛性地圖變形 | Elastic LiDAR Fusion 以變形圖處理迴圈,不維護全域軌跡;Kintinuous(RGB-D)以 as-rigid-as-possible 空間變形校正稠密地圖;Kimera-Multi(視覺慣性)以錨定在關鍵影格的變形圖校正網格。 (Park et al., 2018; Park et al., 2022; Whelan et al., 2015b; Tian et al., 2022) | 表面被連續變形。Elastic 系列的期刊延伸(ElasticLiDAR++)報告,60 m 尺度地圖的失真可達 10 cm,並預期隨地圖增大而增加;Kintinuous 作者指出重複經過的區域不會重新融合,因而產生疊影(aliasing)。 |
| 解除融合後以新位姿重新融合 | BundleFusion(RGB-D)在位姿改變時即時把受影響影格從 TSDF 移除,再以新位姿重新融合。 (Dai et al., 2017a) | 融合表面依新位姿重建;作者報告目前實作以兩張 GPU 執行,現有硬體設定下資料量上限約 25,000 影格(30 Hz 約 14 分鐘)。 |
| 位姿圖最佳化後重建局部地圖,再以 BA 精修 | Voxel-SLAM 只在迴圈偵測估得的漂移距離超過門檻(例如 0.1 m)時,以 GTSAM 執行位姿圖最佳化並重建供里程計與局部建圖共用的體素地圖;全域建圖採階層式 BA:即時階段做關鍵影格視窗 BA(視窗 10、步距 5),作業結束後再對子地圖做由粗到細體素化的全域 BA 與由上而下的位姿圖最佳化,也可跨時段進行(期刊版 Sec. 8.2, 9)。 (Liu et al., 2026) | 局部地圖依修正後位姿重建;整體一致性交由階層式 BA 處理,其中子地圖層級的全域 BA 在作業結束後執行。 |
| 直接以點雲一致性精修 | BALM2、HBA 與 LEMON-Mapping 以點到平面(或邊緣)殘差直接最佳化多幀位姿;LEMON-Mapping 作者指出只把迴圈當作位姿之間的約束、忽略地圖幾何,會使重疊區發散與模糊。 (Liu et al., 2023a; Liu et al., 2023b; Wang et al., 2026) | 以重疊區的幾何一致為目標,而不只是讓位姿滿足相對約束。 |
| 沒有迴圈修正 | FAST-LIO2 以里程計頻率把點插入 ikd-Tree 地圖,不含迴圈偵測與修正;地圖只保留邊長 L 的立方體區域(預設 1000 m),區域在 LiDAR 偵測範圍觸及邊界時才隨之移動。 (Xu et al., 2022) | 已插入的點不會因後來的重訪而被修正(推論)。 |
位姿品質也會傳到下游處理。DUFOMap 作者比較不同位姿來源,所有受測的動態點移除方法都受位姿品質影響,位姿越差場景看起來越「動態」 (Duberg et al., 2024, Sec. V-C, Table III);Dynablox 的模擬漂移實驗顯示,漂移主要降低精確率 (Schmid et al., 2023, Sec. VII-C)。因此工程流程宜先完成全域修正或多時段對齊,再做動態點移除與變化偵測(推論)。
光達光束法平差:以點雲一致性精修
位姿圖只要求位姿滿足相對約束;光束法平差(bundle adjustment, BA)則直接要求同一平面或邊緣上的點在各幀之間對齊。以平面特徵為例,可寫成下式(示意,符號為本站所用):
是第 j 幀位姿, 是落在第 f 個平面上的點, 是平面參數。
Liu 與 Zhang 的 BALM 把光達 BA 定義為最小化各特徵點到所屬邊緣或平面的距離,並證明邊緣與平面參數可用封閉解消去,使最佳化只剩掃描位姿;自適應體素化(adaptive voxelization)以八元樹切分空間,直到每個體素只含單一平面或邊緣 (Liu & Zhang, 2021, Sec. I, IV)。作者指出自適應體素化需要良好的初始位姿 (Liu & Zhang, 2021, Sec. VII)。
BALM2 提出「點簇」,把同一特徵上的所有原始點壓縮為一組緊湊參數,使代價、導數與不確定度的計算都不需逐點列舉 (Liu et al., 2023a)。作者主張直接最小化點到特徵殘差,比位姿圖最佳化更直接強化地圖一致性 (Liu et al., 2023a, Sec. VIII-B);代價是所有掃描一次最佳化,實驗中因 10 Hz 資料對所有受測 BA 方法都太耗時而降為 2 Hz (Liu et al., 2023a, Sec. VI-B)。
在 Hilti 2021 資料集的 Construction2 工地序列上(手持 Ouster OS0-64、所有方法共用同一初始軌跡、以 FAST-LIO2 去畸變、2 Hz),BALM2 作者報告三種 BALM2 變體的 ATE RMSE 為 0.0553 至 0.0577 m,BALM 為 0.068 m,Eigen-Factors 為 0.086 m (Liu et al., 2023a, Sec. VI-B, Table II)。地圖一致性則以 0.1 m 格的佔用格數評估,不需參考地圖 (Liu et al., 2023a, Sec. VI-B2)。這是公開資料集層級的工地證據,不是作者自行在工地部署,也沒有與構件尺寸比對。
HBA 以由下而上的分層 BA 降低大場景的計算量,再以局部 BA 的 Hessian 作為資訊矩陣,由上而下以位姿圖把結果傳回所有原始幀 (Liu et al., 2023b, Sec. III)。作者的出發點是:位姿圖最佳化省時但不直接最佳化地圖一致性,而原始光達 BA 在大場景過於耗時 (Liu et al., 2023b);HBA 本身需要初始軌跡 (Liu et al., 2023b, Sec. III-A)。
多時段情境中,Voxel-SLAM 以階層式全域 BA 處理一致性。在 Hilti 資料集同一施工現場(site1)的五段手持序列上,作者報告合併後的多時段 ATE 由僅做位姿圖最佳化的 7.6 cm 降至全域建圖後的 4.9 cm (Liu et al., 2026, Sec. 10.3.1, Table 5(期刊版))。LEMON-Mapping 對孤立迴圈使用建立在 BALM2 上的擴散式 BA、對成群迴圈使用空間化 HBA,並以 DJI L1 高精度點雲為參考,在三個 MARS-LVIG 大場景報告平均 Wasserstein 距離 0.25 至 0.65 m、Chamfer 距離 0.43 至 1.11 m (Wang et al., 2026, Sec. VII-D, Table V)。
多時段、長期與參考圖對齊
Rosen 等人把非靜態世界分為高度動態、半靜態與可變形三類;半靜態變化只能透過重複造訪觀察,需要環境記憶 (Rosen et al., 2021, Sec. 3.3)。工地逐期掃描屬於這類問題(推論)。多時段建圖(multi-session mapping)要解決的,是把原點不同、各自漂移的時段放進同一座標,再判斷哪些差異是真實變化。
LT-mapper 以錨節點(anchor node)多時段位姿圖與 Scan Context 跨時段迴圈,對齊原點不同、各自漂移的時段,不需良好初始對齊;再以集合差分分出新出現與消失的點 (Kim & Kim, 2022, Sec. III 至 IV)。作者報告跨時段迴圈降低了各時段內部的漂移 (Kim & Kim, 2022, Sec. V-B)。maplab 2.0 的地圖由多個任務(mission)組成,mapping server 先各自局部最佳化,再做跨機迴圈與聯合最佳化;離線工具提供地圖合併與以 ICP/G-ICP 產生的光達迴圈 (Cramariuc et al., 2023, Sec. III)。作者以含工地序列的 Hilti 2021 資料評估 (Cramariuc et al., 2023, Sec. IV-A);在兩段 Construction 序列上,maplab 2.0 的 FAST-LIO2 + SP + B 配置 APE RMSE 為 0.04 m 與 0.07 m,與單獨 FAST-LIO2 相同;明顯改善只出現在 Parking 序列(5.00 m 降至 0.21 m) (Cramariuc et al., 2023, Table II)。光達與視覺迴圈邊使用經驗設定的固定共變異數 (Cramariuc et al., 2023, Sec. III-A, IV-A)。
Kimera-Multi 是分散式的多機(視覺慣性)度量語意 SLAM,以分散式 GNC 穩健位姿圖剔除錯誤迴圈,再以變形圖依最佳化軌跡校正網格 (Tian et al., 2022)。LTA-OM 以最佳化後的位姿校正歷史子地圖點並重建 ikd-Tree,讓校正後的歷史地圖直接參與掃描對地圖配準 (Zou et al., 2024, Sec. 4.4);多時段模式可載入前次由 LTA-OM 產生的地圖接續建圖,並在 4.9 至 7.5 s 內於前次地圖上重新定位,其他系統產生的地圖則不相容 (Zou et al., 2024, Sec. 4.5, Remark 4, Table 9)。作者在三個樓層走廊尺寸相同的多層建築中蒐集資料,偵測到的迴圈約半數為誤判,其誤判剔除機制仍建出一致地圖,改用 Cauchy 穩健估計時迴圈閉合則失敗 (Zou et al., 2024, Sec. 5.4, Fig. 11)。LAMM 是離線的多時段地圖合併框架:輸入各序列由前端 SLAM(如 FAST-LIO2)得到的掃描與初始位姿,以 BTC 描述子搜尋序列內與序列間迴圈,以 RANSAC 聚類剔除序列間的離群迴圈,再依連通性把序列分組,各組以 GTSAM 做位姿圖最佳化 (Wei et al., 2025b, Sec. III-B 至 III-E);作者也把 Ouster OS2-128 與 Livox Avia 的序列合併成一張地圖 (Wei et al., 2025b, Table V)。LAMM 只以位姿圖合併,沒有地圖層級的重疊區精修 (Wei et al., 2025b, Sec. III-E3),LEMON-Mapping 作者則指出這會使重疊區殘留局部發散 (Wang et al., 2026, Sec. II-B)。
以 BIM 或既有點雲作為參考時段
BIM-SLAM 從 IFC 模型萃取牆、樓板等永久構件並模擬光達掃描,產生具真值位姿的「BIM 時段」;真實時段以錨節點多時段位姿圖對齊到被強先驗固定的 BIM 時段,再以點到網格距離找出模型外的新物件 (Vega Torres et al., 2023, Sec. 3)。在單一模擬序列上,其漂移改善只略優於 SC-A-LOAM;真實資料在與模擬相同的室內環境蒐集,只有定性結果,文中未說明該建築的類型或是否為施工中 (Vega Torres et al., 2023, Sec. 4 至 5)。方法只偵測模型外新增的物件,BIM 中已不存在的構件列為未來工作 (Vega Torres et al., 2023, Sec. 6)。
SLAM2REF 以 DLIO 去畸變並提供里程計,用室內版 Scan Context 與 YawGICP 對參考圖的模擬掃描建立跨時段迴圈,經多時段錨定位姿圖後,再逐幀以點對點 ICP 對齊 1 cm 密度的參考點雲 (Vega-Torres et al., 2024, Sec. 4.2)。以 BIM 為參考對齊 ConSLAM 施工中建物資料的序列 2 時,作者報告最終 ICP 後相對於 TLS 推得之參考位姿的平移絕對位姿誤差(absolute pose error, APE) RMSE 為 14.8 cm、旋轉 0.56° (Vega-Torres et al., 2024, Sec. 6, Fig. 12)。作者也指出方法對初始 SLAM 位姿敏感:狹窄走廊缺少地板或天花板點時,z 向漂移可能無法修正 (Vega-Torres et al., 2024, Sec. 8)。
營建工程意義與證據缺口
Cadena 等人以建築或橋梁的結構檢測為例,說明此類任務需要全域一致的 3D 重建;這是作者的論述,不是實驗 (Cadena et al., 2016, Sec. I)。直接的工地證據仍少。Feng 等人在一棟主體已封頂、機電與裝修並行的醫院門診大樓施工現場,以官方預設參數比較十種開源 3D LiDAR SLAM;作者報告 LiDAR-only 方法普遍出現 z 軸漂移與地圖翹曲,LiDAR 與 IMU 緊耦合的方法可大幅減輕 (Feng et al., 2025, Sec. 5.2 至 5.3)。
解讀這項研究時有三個限制:其模擬工地的軌跡沒有迴圈重訪,迴圈閉合在該測試中無從發揮作用 (Feng et al., 2025, Sec. 3.2);實際工地 APE 所用參考軌跡的來源,以及兩組資料計算 APE 前的軌跡對齊方式,論文都未說明 (Feng et al., 2025, Sec. 5.1, 5.3, Table 4);點雲地圖品質以目視檢查三視圖評估,沒有對參考量測的數值 (Feng et al., 2025, Sec. 5.1)。
座標基準要明確定義
Triggs 等人強調規範自由度(gauge freedom),也就是座標基準,必須明確固定,不同基準下的結果與不確定度看起來會不同 (Triggs et al., 2000, Sec. 9);作者也指出,控制點、GPS 或慣性讀值等外部資訊可作為獨立成本項併入平差 (Triggs et al., 2000, Sec. 3.1)。Grisetti 等人的教學文說明,約束誤差對所有位姿的整體剛體變換不變,線性系統因此欠定,常見做法是固定其中一個節點(其 Algorithm 1 固定首節點) (Grisetti et al., 2010, Sec. IV-B, Algorithm 1)。LIO-SAM 以 GNSS 因子引入絕對量測 (Shan et al., 2020, Sec. III-D),但作者也報告 GPS 高程很不準確,在沒有迴圈時其測試中的高度誤差接近 100 m (Shan et al., 2020, Sec. III-E)。要讓 SLAM 點雲對齊工地控制點或 BIM 座標,需以控制點或先驗因子明確定義基準,並保留未參與估計的點作為檢核(推論)。