相機與深度相機
相機是視覺 SLAM 的核心感測器,但一張影像只記錄方向,不記錄距離。本頁以四組三維互動圖說明相機如何把三維場景投影成像素、為什麼單眼影像無法決定尺度、立體相機與深度相機如何取回距離,以及稀疏特徵與稠密深度兩種成點方式的差別,並對照本站已查證的文獻,討論素面牆、陽光、玻璃與深色材料在工地上可能造成的影響,以及目前的證據缺口。
本頁內容
針孔模型:從三維點到像素
理想相機可以用針孔模型(pinhole camera model)描述:場景點的光線都通過同一個投影中心(centre of projection),落在其後方的影像平面上。以相機座標系表示時( 沿光軸向前),點 的像素座標為:
是以像素為單位的焦距, 是主點(principal point),合稱內參(intrinsic parameters)。把世界座標到相機座標的剛體轉換 (外參(extrinsic parameters))一起寫入,就得到齊次形式:
等於點的深度 。投影時除以深度,深度本身就消失了:一個像素只對應一條從投影中心出發的射線,不對應一個點。以上是幾何光學的推導,不是特定文獻的結果;實際鏡頭另有畸變,須由校正取得並修正。
單眼相機的尺度模糊
把整個場景連同相機的位置與運動一起放大 倍,每個點相對於相機中心的位置向量都只放大 倍、方向不變,也就是點沿著原來的投影射線外移,投影後的像素完全相同:
因此只靠一台相機的影像,重建出的地圖與軌跡只確定到一個未知的比例,這稱為尺度模糊(scale ambiguity)。這是射影幾何的推導,不是特定文獻的結果。在已查證的文獻中,ORB-SLAM 的單眼模式要先把尺度與真值對齊後才報告精度(Mur-Artal et al., 2015, Sec. IX-A);沒有迴圈可修正時,尺度還會隨時間漂移,作者在 KITTI 08 序列觀察到約為軌跡尺寸 5% 的誤差(Mur-Artal et al., 2015, Sec. VIII-E, Fig. 12)。ORB-SLAM3 在單眼或尚未成熟的單眼慣性地圖中,以含尺度的相似轉換 Sim(3) 對齊迴圈或地圖合併的候選,其餘情況才用剛體 SE(3)(Campos et al., 2021, Sec. VI-A)。
要讓尺度可觀測,必須引入一個以公尺計的量。下圖比較兩種常見來源:
- IMU:加速度計以 m/s² 量測比力(含重力),扣除重力後即為公制的加速度。影像重建出的軌跡二次微分後,與 IMU 加速度只差一個比例 ,可用最小平方估計(下式假設重力已扣除、姿態已知): 分母顯示,相機若靜止或等速前進, 趨近零,尺度就無法估計(推導)。VINS-Mono 以單眼相機加低成本 IMU 估計具公制尺度的狀態,初始化時先做僅視覺的運動恢復結構,再與 IMU 預積分對齊,求出陀螺儀偏差、速度、重力方向與尺度(Qin et al., 2018);作者在引言指出公制尺度需要加速度激勵(Qin et al., 2018, Sec. I),並提醒視運動與環境而定,系統可能變成弱可觀測或退化(Qin et al., 2018, Sec. X)。ORB-SLAM3 的 IMU 初始化在 2 s 後尺度誤差約 5%,15 s 後約 1%(Campos et al., 2021, Sec. II-B, V-A to V-C);作者也指出緩慢運動或缺少俯仰與側滾激勵(如平地上的車輛)時 IMU 難以初始化,純旋轉探索時單眼慣性模式無法估計深度(Campos et al., 2021, Sec. VIII)。
- 已知基線:立體相機兩個鏡頭的間距 由校正以公尺求得,單一影格就能三角量測出公制深度。ORB-SLAM2 把深度小於 40 倍基線的立體特徵視為近點,只用一個影格就能三角化並帶有尺度;遠點仍須多個影格(Mur-Artal & Tardos, 2017, Sec. III, III-A)。
三維教學模擬:施工中樓層上,三腳架滑軌上的相機左右移動,細線是從投影中心射向場景點的投影射線,鏡頭前的影像平面與右下角小窗顯示相機看到的影像;放大倍率滑桿把整個場景連同相機與腳架放大,影像保持不變。
三維場景載入中…
操作方式:拖曳旋轉視角,右鍵或 Shift 加拖曳平移;點選畫面後可用滾輪縮放;觸控時水平拖曳旋轉、雙指縮放,垂直滑動捲動頁面。聚焦畫面後,方向鍵平移,Shift 加方向鍵旋轉,加號與減號縮放,數字 0 重設視角。所有動作也可用下方工具列完成。
看什麼:拖動 :整個工地、工人、三腳架、相機與滑軌的行程一起放大或縮小,但右下角的相機影像與鏡頭前的影像平面完全不變;讀數「兩種世界的影像差」以相同的投影公式逐點計算,始終為零。改選「IMU 加速度」:青色箭頭是 IMU 量到的加速度,上方的橘色箭頭是假設世界所需的加速度(為前者的 倍),只有 時兩者等長;讀數中的 以含雜訊的模擬加速度估計,應為 。改選「立體基線」:假設的世界需要 倍長的基線,與標定值矛盾。
相機解析度 1280 × 720、水平視角 70°、滑軌振幅 ±0.3 m 與 IMU 雜訊都是示意參數。小窗的霧化距離隨 同比例調整,讓兩個世界的影像逐像素相同。投影射線與顏色是教學視覺化;設備是通用外型,不是特定產品;場景為模擬,不是實測資料。
立體相機:視差與深度誤差
兩台平行、已校正的相機相距基線 ,同一點在左右影像同一列上的橫向位移稱為視差(disparity) 。由相似三角形:
視差的量測誤差 (匹配雜訊,以像素計,下圖取次像素的示意值)經過這個倒數關係傳到深度,一階近似為:
深度誤差隨距離平方成長、與基線成反比,橫向誤差只隨距離線性成長,因此遠處點的不確定度是一個沿視線拉長的細長橢球。以下圖的示意參數( px、 m、 px)計算,5 m 處 約 5.7 cm,10 m 處約 22.8 cm。以上是物理原理推導,不是特定文獻的結果。
視差要靠立體匹配(stereo matching)取得:在右影像同一列上,逐一比較候選視差處的影像區塊與左影像區塊,取代價最小者。若區塊內幾乎沒有灰階變化,所有候選的代價都差不多,找不到明確的最小值,匹配只能放棄;下圖的匹配器以區塊內的灰階標準差與「最小代價對次小代價的比值」兩項檢查決定是否接受;兩項檢查與門檻都是教學用的示意模型,不代表特定匹配器的實作。
文獻中的立體相機系統基線差異很大:ORB-SLAM2 使用的 EuRoC 資料集立體相機基線約 11 cm,KITTI 約 54 cm,均為該研究報告的規格(Mur-Artal & Tardos, 2017, Sec. IV-A, IV-B)。S-MSCKF 的作者指出,以 KLT 做立體匹配時,20 cm 基線下深度大於約 1 m 的角點才可靠(Sun et al., 2018, Sec. III-E);在 EuRoC V2_03 序列中,左右影像亮度不一致使 KLT 立體匹配失效,濾波器因此發散(Sun et al., 2018, Sec. IV-A)。StereoScan 以稀疏特徵做每秒 25 幀的里程計,另以稠密立體匹配每秒產生 3 至 4 張視差圖,依位姿重投影後融合成點雲(Geiger et al., 2011, Sec. III);但其三維重建只做了定性展示(Geiger et al., 2011, Sec. IV-C)。
三維教學模擬:施工中樓層上,裝在橫桿上的兩台相機對準圓柱,左右投影中心各有一條射線交會於目標點(柱面或牆面);橘色虛線是視差搜尋中的候選射線,目標點上的橢球表示深度不確定度,小窗(寬畫面在右下角,手機在上方)畫出左右影像同一列的像素與匹配代價;立體匹配產生的點依深度誤差著色。
三維場景載入中…
操作方式:拖曳旋轉視角,右鍵或 Shift 加拖曳平移;點選畫面後可用滾輪縮放;觸控時水平拖曳旋轉、雙指縮放,垂直滑動捲動頁面。聚焦畫面後,方向鍵平移,Shift 加方向鍵旋轉,加號與減號縮放,數字 0 重設視角。所有動作也可用下方工具列完成。
看什麼:橘色候選點沿左相機射線來回滑動:每個候選視差 對應深度 ,小窗(寬畫面在右下角,手機在上方)的代價曲線在真實視差處最低。把深度拉到 10 m 以上或縮短基線:目標點上的橢球沿視線拉長(半軸為 2σ),點雲沿射線方向散開,遠處的點依誤差由藍轉紅(色階 0 至 0.3 m)。把柱後牆面改成「粉刷塗漆」:牆上的點消失,目標點改選「牆面」時,代價曲線沒有明顯的最小值。
點雲每 0.25 s 由一幀立體匹配產生:右相機看不到的點(遮擋)與未通過匹配檢查的點都不產生;少數紋理相似處造成、又通過重複檢查的錯誤匹配會留下離群點。相機解析度、焦距與雜訊都是示意參數。射線、候選點與顏色是教學視覺化;設備是通用外型,不是特定產品;場景為模擬,不是實測資料。
立體深度誤差隨距離的平方成長(示意)
σZ = Z² σd ÷ (f B),f = 914 px(影像寬 1280 px、水平視角 70°),σd = 0.25 px;三條線是三種基線。
按下圖例項目只顯示該系列,再按一次恢復全部系列。
按 Tab 進入圖表後,用左右方向鍵沿橫軸移動,Esc 關閉提示框;也可開啟表格檢視閱讀全部數值。
距離加倍時誤差變為四倍;基線加倍時誤差減半。以三維圖目前的基線 0.12 m 與視差雜訊 0.25 px 計算,σZ 在約 4.7 m 處達到 5 cm。這是一階近似,忽略了校正誤差、錯誤匹配與遮擋。
資料來源物理原理推導;示意參數,不是任何設備的規格
素面牆與低紋理
低紋理是以影像為主的方法的共同弱點。ORB-SLAM3 的作者把低紋理環境列為主要失效情境(Campos et al., 2021, Sec. VIII);VIL-SLAM 在無特徵的走廊中,牆面使視覺慣性里程計約束不足,地圖在迴圈閉合前出現錯位(Shao et al., 2019, Sec. VIII-B)。營建相關的證據來自一份在室內施工現場錄製的 RGB-D 資料集:序列包含低紋理、反光、過曝與有工人走動的場景(Li et al., 2025, Fig. 7, Table 3),ORB-SLAM 在貼近灰色低紋理牆面時無法完成軌跡(Li et al., 2025, Sec. 3, Fig. 2, Fig. 8b);不過該文沒有報告任何量化的軌跡或地圖誤差(Li et al., 2025, Sec. 3, Fig. 8a, Fig. 9),同儕審查狀態也尚未確認。Yarovoi 與 Cho 的回顧同樣把素面石膏板牆與室內外混合照明列為營建部署的考量(Yarovoi & Cho, 2024, Sec. 2, 3.2, 3.4)。
深度相機:主動投射的光
深度相機(depth camera)自己發出近紅外光,因此在紋理稀少的表面也能量到深度。常見的兩類原理是結構光(structured light)(包含主動立體視覺)與間接飛時(indirect time of flight, iToF)。
結構光:點陣位移與三角量測
以參考平面比對的結構光原理如下(原理說明,不是特定產品的實作):投影器把固定的偽隨機光點圖樣投向場景,紅外相機從相距基線 的位置拍攝。與預先記錄在參考平面 上的圖樣相比,每個光點沿基線方向的位移 決定其深度:
這與立體相機的視差關係相同,因此深度雜訊同樣隨 成長(推導)。以示意參數 px、 m、位移雜訊 0.15 px 計算,3 m 處約 3.2 cm。Henry 等描述的 PrimeSense 主動立體相機(等同 Kinect 感測器)以紅外發射器與紅外相機取得 640 × 480、每秒 30 幀的深度影像,並指出這類相機的深度通常小於 5 m、3 m 處雜訊約 3 cm、視角約 60°,均為該研究報告的規格(Henry et al., 2012, Sec. 1; Sec. 3.1.1);ICL-NUIM 資料集則以視差雜訊與量化模擬 Kinect 式的深度雜訊(Handa et al., 2014, Sec. V)。ORB-SLAM2 把 RGB-D 深度換算成虛擬的右影像座標,Kinect 與 Asus Xtion 的結構光基線近似取 8 cm(Mur-Artal & Tardos, 2017, Sec. III-A);作者也說明 TUM RGB-D 資料集 freiburg2 序列的深度圖約有 4% 的尺度偏差,並在自己的實驗中補償(Mur-Artal & Tardos, 2017, Sec. IV-C)。
光點能否被偵測,取決於光點訊號 與環境光 的相對大小。以光子雜訊為主的簡化模型為:
光點訊號隨距離平方與入射角餘弦下降,並與表面的近紅外反射率成正比;環境光進入像素的量不隨距離衰減。下圖假設直射陽光即使經過感測器的窄頻濾光,仍比 1 m 處白色表面上的光點強數十倍。這是輻射度學的簡化推導,下圖的常數都是示意參數。
間接飛時:每個像素量相位
iToF 相機以調變頻率 的泛光照亮整個視野,每個像素量測回波調變相對發射調變的相位 :
相位每 循環一次,距離只在不模糊距離(unambiguous range) 內唯一:20 MHz 時為 7.49 m,100 MHz 時只有 1.50 m,更遠的表面會「折回」到近處。若一個像素收到多條光路(例如牆角處,光先照到另一面牆再反射過來),量到的是各路相量的和:
由三角不等式,間接光路總是比直接光路長;只要兩者的相位差小於半個週期,相量和的相位就落在兩者之間,因此多路徑(multipath)干擾會讓凹角附近的距離偏長,牆角被量成圓弧。以上是連續波量測的物理原理推導,不是特定文獻的結果;下圖以單次反射、忽略遮蔽的教學模型計算。已查證文獻中,Keller 等的點式融合除了 Kinect 也以 200 × 200 的 PMD 飛時相機測試,並把每個像素的振幅納入樣本的信心權重(Keller et al., 2013, Sec. 3, Sec. 7, Table 1)。
三維教學模擬:施工中建築的下層樓板上,三腳架上的 RGB-D 深度相機對著粉刷牆角、待安裝的玻璃與黑色塑膠布覆蓋的材料投射近紅外光點,由開放的樓板邊緣射入的陽光照亮部分地面與牆腳;右下角小窗顯示紅外影像或每像素相位。
三維場景載入中…
操作方式:拖曳旋轉視角,右鍵或 Shift 加拖曳平移;點選畫面後可用滾輪縮放;觸控時水平拖曳旋轉、雙指縮放,垂直滑動捲動頁面。聚焦畫面後,方向鍵平移,Shift 加方向鍵旋轉,加號與減號縮放,數字 0 重設視角。所有動作也可用下方工具列完成。
看什麼:結構光模式下,粉紅色小點是被紅外相機偵測到的投射光點,灰色小點是沒被偵測到的光點。對準「陽光」:地面與牆腳照到陽光的區域光點被淹沒,小窗中成為灰色光暈;切換到深色主題時,改由鹵素工作燈提供強烈的近紅外環境光。對準「深色與玻璃」:黑色塑膠布反射太少,落在上面的光點大多偵測不到,只在距離較近、正對相機的側面留下稀疏的點;光點穿過玻璃落在後方牆面,玻璃本身沒有點。小窗中光點旁的短線是相對參考平面的位移,近處與遠處的方向相反。
切換到「間接飛時」並對準「牆角」、著色改為「深度誤差」:凹角附近的點被量得偏遠。對準「遠處」並把調變頻率提高到 100 MHz:超過不模糊距離的表面折回到相機前方,形成不存在的假面。相機與投影器的視角、基線、反射率與環境光強度都是示意參數。
可見的光點、光束、相位色彩與點的顏色都是教學視覺化:深度相機使用的近紅外光人眼不可見。設備是通用外型,不是特定產品;場景為模擬,不是實測資料。
深度相機在工地的限制
KinectFusion 的作者說明,Kinect 在不反射紅外光的材料、非常細的結構與掠射角的表面會出現空洞,快速移動也會造成模糊;系統以約 0.4 至 8 m 的保守範圍做光線投射(Newcombe et al., 2011b, Sec. 2.1; Sec. 3.4)。由於只使用深度,它對室內照明條件不敏感(Newcombe et al., 2011b, Sec. 4.3);但大片平面占滿視野時,ICP 有三個自由度不受約束,會漂移或失敗(Newcombe et al., 2011b, Sec. 4.3)。RGBDSLAMv2 的作者指出,結構光感測器通常無法在直射陽光下使用、量測距離短,在大型廳室中會出現缺乏特徵又沒有深度的路段(Endres et al., 2014, Sec. II, IV-A)。
本站紀錄中,深度相機在營建現場建圖的直接證據屬先導規模。Shang 與 Shen 在無人機底部朝下安裝一台 RGB-D 相機(紅外雷射投影器加兩個紅外感測器),在碎石基礎溝槽上以 RTAB-Map 即時建圖;作者指出這台相機對戶外照度敏感,需要調整參數,最佳量測距離為 0.5 至 5 m(Shang & Shen, 2018, System architecture; Experimental setup; Table 1),模型中央因紅外量測距離不足而出現空洞(Shang & Shen, 2018, Accuracy evaluation)。以攝影測量模型為參考、在 8 個人工選取的角點間比較邊長,平均單位誤差為 3.3 cm,作者也說明此比較未考慮量測誤差(Shang & Shen, 2018, Field applications: Accuracy Evaluation; Figure 4)。
從影像到點:稀疏與稠密
相機產生點的方式可分成兩大類。稀疏作法只在容易重複辨認的位置(角點、斑點)偵測特徵,跨影格匹配同一個特徵後,由多條觀測射線求最接近的交點:
其中 是第 個影格的相機中心, 是觀測射線的單位方向。射線間的夾角(視差角)越小,交點沿視線方向越不確定。稠密作法則對每個有深度的像素反投影:
兩式都是幾何推導。稠密點的數量上限由影像解析度決定,品質則取決於每個像素的深度誤差與位姿誤差。
以特徵為主的系統輸出的是稀疏地圖點:ORB-SLAM3 在 EuRoC V202 序列的四種設定中保留 9,686 至 14,245 個地圖點與 135 至 332 個關鍵影格,論文未產生或評估稠密重建(Campos et al., 2021, Table VI; whole paper);Photo-SLAM 在 ORB 特徵點上加入高斯參數以呈現外觀,作者明言網格重建的評估不在範圍內(Huang et al., 2024c, Sec. 4.1)。ORB-SLAM2 論文中的稠密點雲,是以估計的關鍵影格位姿把感測器深度圖反投影所得,不是聯合最佳化的稠密地圖(Mur-Artal & Tardos, 2017, Sec. IV-C; Fig. 7)。DROID-SLAM 為每個關鍵影格估計逐像素的逆深度,但作者表示缺乏評估 SLAM 重建的標準協定,沒有評估三維重建(Teed & Deng, 2021, Sec. 4)。
稠密深度通常還要融合。KinectFusion 把每一幀深度融合進截斷有號距離函數(TSDF)體素(Newcombe et al., 2011b, Sec. 3.3),這種體積式整合源自 Curless 與 Levoy;後者指出表面後方的截斷距離坡道會在薄面兩側互相干擾,使薄面變厚、尖角變圓(Curless & Levoy, 1996, Sec. 7)。RGB-D Mapping 把 95 幀、每幀約 25 萬點的點雲整併成約 73 萬個面元(surfel),約為原本的三十二分之一(Henry et al., 2012, Sec. 4.4)。
三維教學模擬:施工中樓層上,裝在有輪三腳架上的深度相機沿著磚牆、混凝土牆與模板牆移動;青色大點是由多個關鍵影格三角化的稀疏地標,細線是觀測射線,小點是深度像素直接反投影的稠密點雲;右下角小窗顯示最新關鍵影格與追蹤的特徵。
三維場景載入中…
操作方式:拖曳旋轉視角,右鍵或 Shift 加拖曳平移;點選畫面後可用滾輪縮放;觸控時水平拖曳旋轉、雙指縮放,垂直滑動捲動頁面。聚焦畫面後,方向鍵平移,Shift 加方向鍵旋轉,加號與減號縮放,數字 0 重設視角。所有動作也可用下方工具列完成。
看什麼:相機每 0.5 s 取一個關鍵影格。稀疏作法中,青色細線從目前影格射向已三角化的地標,橘色細線來自前一次觀測到該地標的影格,兩者交會處就是地標;小窗中的圓圈是偵測到的特徵,橘色短線是它們與前一影格位置的連線。地標集中在磚牆、混凝土、模板與木料等設定為特徵豐富的材料上(各材料出現可追蹤特徵的機率是示意參數);讀數中的平均誤差是與真實位置比較的結果。稠密作法中,每個取樣的深度像素都成為一點,平整牆面也被完整覆蓋,但點帶有隨距離平方成長的深度雜訊,0.4 m 以內、超過 5 m 或入射角大於 80° 的表面沒有點。
為了只比較成點方式,這裡直接使用真實的相機位姿;位姿本身如何估計,以及誤差如何累積,見 D-07 從量測到點雲地圖。特徵偵測率、像素雜訊與深度模型都是示意參數。射線、標記與顏色是教學視覺化;深度相機投射的近紅外光人眼不可見,圖中未畫出;設備是通用外型,不是特定產品;場景為模擬,不是實測資料。
一個以手持裝置在施工中建築疊合 BIM 的研究,也顯示特徵地圖在工地上的時效問題。Hsieh 等使用 iOS 裝置內建的 ARKit 視覺慣性 SLAM,在一棟地下一層至地上六樓的 RC 施工中建築測試;特徵點地圖在施工持續變動下約 1 至 3 個工作天就失效,必須重新掃描(Hsieh et al., 2023, Sec. 4.2.4)。在單一移動速率試驗中,每秒 0.5 m 以下時虛實物件中心相距 4.3 至 5.2 cm,每秒 1.00 m 時為 7.9 cm(Hsieh et al., 2023, Table 2);作者也指出光線不足與遮擋會影響特徵點建圖(Hsieh et al., 2023, Sec. 8)。該系統只保存稀疏特徵點地圖,不產生稠密點雲(Hsieh et al., 2023, Sec. 4.2.4, 5.2, 6.1; Sec. 6.2, 7)。
論文圖:結構光 RGB-D 擷取設備

用於建立 Replica 的自建 RGB-D 資料擷取設備
出處Straub et al., 2019Fig. 4
原始圖檔開啟原始來源(另開新視窗)
本站修改僅轉換為 WebP 格式
Replica 資料集的網格由這台自建設備取得:紅外投影器產生結構光深度,以 TSDF 融合後抽取網格(Straub et al., 2019, Sec. III)。該文為預印本,論文未報告網格相對獨立量測的幾何精度。
本站證據庫中的相機
本站 361 張方法卡中,感測器欄位提到任何相機的有 167 張:單眼或未註明配置 92 張、立體 30 張、RGB-D 或深度相機 68 張、多相機組 9 張、熱像 3 張。驗證環境含施工中工地的方法卡共 22 張,其中提到相機的只有 9 張,其中 8 張同時列出 LiDAR。
本站方法卡中各類相機的出現次數
依方法卡感測器欄位的文字分類;一張卡可同時屬於多類。第二組長條是驗證環境含施工中工地的卡片。
按下圖例項目只顯示該系列,再按一次恢復全部系列。
按 Tab 進入圖表後,用上下方向鍵逐一瀏覽各類別,Esc 關閉提示框;也可開啟表格檢視閱讀全部數值。
分類只看作者列出的感測器,不代表方法只能用於該類相機;明確標示「未使用」或「未測試」的項目不計入。使用合成資料或公開資料集的卡片也計入,因此張數反映的是文獻使用哪類相機,不是工地實測的次數。
資料來源本站已查證的方法卡(methods.json),於頁面產生時計算
在施工中工地驗證、且列出相機的方法卡: Asadi et al. 2019 SLAM image-to-BIM registration(單眼)、Localization in architectural 3D plans(多相機)、maplab 2.0(多相機)、Probabilistic degeneracy detection (DRPM)(單眼)、PIN-SLAM(RGB-D)、LIO-BIM(RGB-D)、BIM-Loc (S05)(單眼)、FAST-LIVO2(單眼)、FAST-LIVO2 on Resource-Constrained Platforms(單眼)。列出相機不代表相機參與了工地驗證:部分卡片的相機只用於合成資料、視覺化或標記偵測,須回到各方法卡的感測器欄位確認。其他以相機為主的工地研究(如上文的 Shang 與 Shen、Hsieh 等,以及施工現場 RGB-D 資料集)屬於應用研究或資料集紀錄,不在方法卡統計內。可在 設備與感測器頁查看 RGB-D 設備的原始規格文字。
延伸閱讀:相機與 IMU 的融合與時間同步見 D-05 IMU 與多感測器融合;點如何經由外參與軌跡落到地圖上,見 F-01 一個點如何落到地圖上;代表性方法卡見 ORB-SLAM3、KinectFusion與 VINS-Mono。LiDAR 點如何取得相機影像的實際顏色,見 D-08 彩色點雲:LiDAR 加相機。
下一步:相機與深度相機只是產生量測的一環;量測如何變成一致的點雲地圖,見 D-07 從量測到點雲地圖。