本文所分享的論文,其通訊作者為香港科技大學(廣州)賀登博老師,如需了解更多研究動態或實驗室信息,訪問實驗室:HIS Lab - Homepage

文末有原文分享!
標題:Driver cognitive load estimation in conditional driving with aligned attention-enabled multimodal fusion(條件自動駕駛下基于對齊注意力多模態融合的駕駛員認知負荷估計)
作者:Ange Wang,Haohan Yang,Jiyao Wang,Hai Yang,Dengbo He(通訊作者)
出版年份:2026
期刊名稱:Transportation Research Part C(交通領域頂級期刊,JCRQ1/中科院1區)
卷期信息:183卷,105471
摘要:盡管自動駕駛在提升道路安全性方面展現出巨大潛力,但在有條件自動駕駛車輛中,駕駛員仍然承擔著行車安全的責任,因此駕駛員狀態依然對行車安全至關重要。雖然駕駛自動化可以降低駕駛員的任務負荷,但他們仍可能經歷較高的認知負荷,從而削弱接管性能。然而,現有的認知負荷估計算法主要針對非自動駕駛車輛設計,在有條件自動駕駛車輛中可能不再適用,原因在于駕駛員的職責差異以及某些指標的不可獲得性(例如,駕駛員未操控車輛時,駕駛行為指標缺失)。此外,現有的駕駛員認知負荷算法很少考慮將輸入特征中的空間信息與時間信息進行融合。
為此,我們提出了一種對齊注意力Transformer網絡,該網絡將多流Transformer網絡與對齊注意力機制相結合,用于估計有條件自動駕駛車輛中駕駛員的認知負荷。該算法融合了可在車內以非侵入方式測量的生理信號,即心電信號(ECG)、皮電信號(EDA)、呼吸信號(RESP)。為了驗證算法的有效性,我們在一個歐洲公開數據集的基礎上,進一步構建了中國駕駛員數據集,其中包含42名駕駛員在執行多種認知任務(記憶、計算和空間任務)時的數據。結果表明,無論是在被試內驗證還是被試間驗證的數據劃分下,本文算法均優于當前先進的駕駛員認知負荷估計算法。此外,消融實驗驗證了算法的魯棒性以及各網絡模塊的有效性。本研究可為非自動駕駛車輛及條件自動駕駛車輛中的駕駛員狀態監測系統設計提供指導。
01
研究背景
自動駕駛雖有望提升道路安全,但SAE L3級條件自動駕駛下,駕駛員仍需對行車安全負最終責任,駕駛員狀態直接決定接管安全。
現有研究存在兩大核心缺口:
絕大多數認知負荷估計算法針對非自動駕駛車輛設計,無法適配L3級場景(駕駛員無需持續控車,傳統駕駛績效、眼動指標存在局限性);
現有算法大多依賴手工提取生理特征,忽略生理信號的時空依賴關系,存在信息損失、泛化性差的問題。
本研究旨在填補上述空白,提出適配L3級自動駕駛的認知負荷估計算法,驗證其精度與魯棒性。

圖1 擬議的CogFormer系統用于駕駛員認知負荷檢測的概述
02
理論基礎
認知負荷理論:認知負荷是個體完成任務時所需的信息處理容量與認知資源,高認知負荷會導致駕駛員反應延遲、風險感知能力下降,嚴重損害自動駕駛接管性能。
多模態融合理論:多生理信號(心電、皮電、呼吸)可從不同維度反映自主神經活動,相比單一信號,能更全面、精準地表征駕駛員認知負荷水平。
Transformer注意力機制理論:自注意力機制可有效捕捉時序信號的長距離依賴關系,對齊注意力可實現多模態信號的有效融合,解決傳統模型時空信息利用不足的問題。
03
研究假設
假設1:本研究提出的CogFormer模型,在L3級條件自動駕駛場景下,駕駛員認知負荷估計的準確率、F1分數、AUC指標,顯著優于現有主流基線模型。
假設2:ECG、EDA、RESP三類生理信號的全量融合,相比單一信號、雙信號組合,能顯著提升模型的認知負荷估計性能。
假設3:多流Transformer編碼模塊、對齊注意力模塊,是CogFormer模型的核心貢獻模塊,剔除任一模塊都會導致模型性能顯著下降。
假設4:CogFormer模型在數據缺失、噪聲干擾的真實場景下,魯棒性顯著優于現有主流基線模型。
04
實驗方法
參與者:兩個數據集合計130名有效參與者,其中自建CAM-CLD數據集42名中國駕駛員,公開MADT-D數據集88名歐洲駕駛員。
實驗設計:采用3(接管場景)×7(認知任務類型)的被試內設計,通過拉丁方設計平衡場景與任務的順序效應,合計21種實驗條件,每種條件2名受試者。

圖2 場景流程
模型架構:提出CogFormer對齊注意力Transformer網絡,采用多流Transformer編碼結構,分別對ECG、EDA、RESP信號做特征提取,通過對齊注意力機制在決策層完成多模態融合,最終輸出認知負荷等級分類結果。
數據采集:通過專業傳感器采集100Hz采樣率的ECG、EDA、RESP原始生理信號,同步采集駕駛行為數據與主觀量表評分。

圖3 驅動平臺的設備(a)及生理傳感器的放置位置(b)。
測量工具:采用NASA-TLX任務負荷指數量表、KSS嗜睡量表做認知負荷主觀標注;設置3類認知任務(n-back、數學計算、空間認知)構建不同等級的認知負荷;采用準確率、F1分數、AUC作為模型性能評估指標。

圖4 (a) n-back任務、(b) 數學任務以及(c) 認知空間任務。
驗證方案:采用被試內5折交叉驗證、被試間留一法交叉驗證兩種方案;設置6種主流基線模型做對比;通過消融實驗驗證核心模塊的有效性;通過噪聲/缺失數據測試驗證模型魯棒性。
05
使用設備
緊湊型駕駛模擬器
固定基座駕駛模擬器 + 三聯屏顯示系統 + 駕駛仿真軟件(Silab 7.1),用于搭建 L3 級自動駕駛場景、發出接管指令、記錄駕駛行為。

Physiolab多導生理儀
采集駕駛員的ECG、EDA、RESP數據。
Dikablis 3頭戴式眼動儀
記錄駕駛員在條件自動駕駛過程中的眼動行為數據。

HRT人類行為研究平臺
將ECG、EDA、RESP生理信號與眼動注視軌跡在統一的時間軸上完成精準對齊,同時接入駕駛模擬器的車輛狀態數據,實現“生理—視覺—駕駛行為"三模態數據的聯合采集。

06
核心結果
1.模型精度:本研究提出的CogFormer模型,被試內驗證最高準確率達95.28%,被試間驗證最高準確率達66.59%,兩項核心指標均全面優于所有參比基線模型。

圖5 采用不同時間范圍的被試內數據劃分方案所得混淆矩陣:(a) MADT -D:數學任務;(b)CAM- CLD :認知空間任務;(c)CAM- CLD :數學任務;(d)CAM- CLD :N-back任務。

圖6 采用不同時間范圍的跨被試數據劃分方案所得混淆矩陣:(a) MADT -D:數學任務;(b)CAM- CLD :認知空間任務;(c)CAM- CLD :數學任務;(d)CAM- CLD :N-back任務。
2.多模態融合效能:ECG、EDA、RESP三類生理信號全量融合方案,其識別精度顯著優于單一信號及任意雙信號組合,充分驗證了多模態互補融合的核心價值。

圖7 CogFormer在不同生理信號組合與時間范圍下的預測精度:(a) MADT -D:數學任務;(b)CAM- CLD :認知空間任務;(c)CAM- CLD :數學任務;(d)CAM- CLD :N-back任務。
3.場景魯棒性:在20%數據缺失疊加高斯噪聲的混合干擾場景下,模型精度降幅顯著低于同期基線模型,具備更強的真實場景抗干擾能力。
4.行業共性瓶頸:所有參比模型均出現被試間泛化性能大幅下滑的現象,驗證了個體生理差異是當前駕駛員認知負荷估計領域亟待突破的核心技術難題。
07
討論與結論
核心結論:本研究提出的CogFormer模型,可有效適配SAEL3級條件自動駕駛場景,無需復雜的人工特征提取,僅通過原始生理信號即可實現高精度、高魯棒性的駕駛員認知負荷估計,為自動駕駛駕駛員狀態監測系統的設計提供了核心技術支撐。
研究局限:模型未區分認知負荷的來源;被試間泛化能力仍有不足;未針對接管前瞬時的認知負荷做高精度監測。
未來方向:融合駕駛員視覺行為、交通上下文信息優化模型;設計適配個體差異的泛化算法;拓展接管過程中的認知負荷實時估計研究。
論文中涉及的專業術語列表

原文下載



掃描上方二維碼獲取
立即詢價
您提交后,專屬客服將第一時間為您服務