
文章目錄CSL2018數據集gloss-zip的項目結構如下pose-gloss VS depth-glosscolor-gloss VS depth-glossCSL2018數據集gloss-zip代表的孤立詞語sentence-zip代表的是連續詞語識別gloss-zip的項目結構如下CSL2018 這份gloss-zip里的幾個文件含義大致是color-gloss RGB 彩色視頻數據 depth-gloss 深度視頻/深度模態數據 pose-gloss 姿態關鍵點數據 gloss_label.txt 500 個孤立詞類別名稱 readme.txt 文件命名規則和訓練/測試劃分說明gloss在這里可以理解為“孤立詞手語類別”也就是你現在做的孤立手語識別任務。readme.txt里給了一個例子P01_25_19_2._color.mp4它的解釋是P01 第 1 個表演者 25_19 類別編號計算方式(25-1)*2019 499 2 第 2 次表演 color RGB 視頻所以文件名中間兩段決定類別類別ID (前一段 - 1) * 20 后一段你的例子P01_01_00_0._body.txt計算類別(01 - 1) * 20 00 0所以它對應gloss_label.txt的第1行也就是類別 ID 為0的詞。我已經確認gloss_label.txt是 UTF-8 編碼前幾行是0 情況 1 前途 2 形勢 3 局勢 4 動態因此P01_01_00_0._body.txt對應的確是情況更完整地拆開P01 第 1 個表演者 01_00 類別編號 0對應 gloss_label.txt 第 1 行“情況” 0 第 0 次/某次重復表演 _body.txt 姿態關鍵點文本文件同一個動作樣本在不同模態里可能有對應文件例如概念上會有P01_01_00_0._color.mp4 RGB 視頻 P01_01_00_0._depth.mp4 深度視頻 P01_01_00_0._body.txt 姿態關鍵點你目前實驗用的是pose-gloss所以模型輸入不是 RGB 視頻而是姿態關鍵點序列。如果你以后想做多模態可以考慮把color-gloss的 RGB 視頻、depth-gloss的深度視頻和pose-gloss的關鍵點融合起來。當前第一版代碼可以只做 pose 模態。pose-gloss VS depth-glosspose-gloss里的關鍵點確實有第三維z可以看作帶三維空間信息。但它和depth-gloss不是同一種數據??梢赃@樣區分depth-gloss 原始/近原始的深度視頻 pose-gloss 從視頻或傳感器數據中提取出來的人體骨架關鍵點1. depth-gloss 是什么depth-gloss是深度視頻。它的每一幀通常是一張“深度圖”。普通 RGB 圖像每個像素是顏色R, G, B深度圖每個像素表示距離攝像頭的遠近depth(x, y) 這個像素位置到攝像頭的距離所以 depth 視頻保留的是比較完整的空間表面信息。比如手、身體、背景中每個可見像素大概離攝像頭多遠。它更像這樣第 t 幀H × W 的深度圖 整個視頻[T, H, W]或者編碼成視頻文件后存儲。2. pose-gloss 是什么pose-gloss是姿態關鍵點序列。它不是圖像而是每一幀只保留人體骨架上的若干個關鍵點。你現在用的_body.txt每一行是25 個關鍵點 × 3 維坐標 75 個數它更像這樣第 t 幀25 × 3 整個樣本[T, 25, 3]這里的第三維z可以表示空間第三維但它只描述這 25 個骨架點的位置不包含整張圖像的深度信息。關鍵區別depth-gloss: 保留每個像素的深度信息信息量大接近原始傳感器數據。 pose-gloss: 只保留人體關鍵點的三維坐標信息量小是結構化骨架數據。舉個直觀例子假設一幀畫面里有人在打手語。depth-gloss可能知道畫面中每個像素離攝像頭多遠 手掌表面的大致形狀 身體輪廓 背景距離 手和臉之間的遮擋關系pose-gloss只知道頭、肩、肘、手腕、髖、膝等 25 個關鍵點的位置也就是說depth-gloss 是“整張深度畫面” pose-gloss 是“從畫面中抽出來的骨架點”為什么 pose 里有 z還需要 depth因為pose里的z是關鍵點級別的三維坐標只覆蓋 25 個點。而depth是像素級深度信息覆蓋整張圖像。它們的信息密度不同pose: 25 個點 × 3 個數 depth: 一整張圖每個像素一個深度值假設深度圖是512×424那一幀就有512 × 424 ≈ 217000 個深度值而 pose 一幀只有25 × 3 75 個數所以兩者不是重復關系而是“原始深度模態”和“結構化姿態模態”的區別。一句話總結pose-gloss 里的 z 是“骨架關鍵點的深度/三維坐標” depth-gloss 是“整幀圖像每個像素的深度視頻”。color-gloss VS depth-gloss磁盤里的color-gloss/depth-gloss通常是視頻文件或壓縮包不是直接保存成.npy形式的[T,H,W]數組。只有解碼后才可以把它們理解成張量。color-gloss: RGB 彩色視頻 解碼后概念形狀[T, H, W, 3]其中T 幀數 H 圖像高度 W 圖像寬度 3 RGB 三個顏色通道每個像素類似[R, G, B]而depth-glossdepth-gloss: 深度視頻 理想情況下解碼后概念形狀[T, H, W]其中每個像素不是顏色而是深度值depth[y, x] 該像素位置距離攝像頭的遠近所以可以這樣對比color-gloss 一幀H × W × 3 depth-gloss 一幀H × W pose-gloss 一幀25 × 3更直觀地說color-gloss: 看“這個地方是什么顏色” depth-gloss: 看“這個地方離攝像頭多遠” pose-gloss: 只看“人體關鍵點在哪里”不過實際處理中要注意一點有些數據集會把深度視頻編碼成普通視頻格式為了存儲方便讀出來時可能暫時表現為H × W × 3的圖像幀但這不代表它是 RGB 顏色信息。它可能是深度值經過編碼、歸一化或偽彩色后的結果。真正用于模型前通常需要按數據集說明或解碼方式還原/讀取深度信息。所以論文里建議寫得嚴謹一點CSL2018 提供 RGB、深度和姿態三種模態。其中 RGB 模態保留顏色與紋理信息深度模態描述像素級空間距離信息姿態模態將每幀手語動作表示為人體關鍵點坐標序列。本文僅采用 pose-gloss 模態即三維姿態關鍵點序列作為模型輸入。一句話總結你的理解方向是對的color 是像素級顏色視頻depth 是像素級深度視頻pose 是關鍵點級骨架序列。