認知障礙包括輕度認知障礙(MCI)及阿茲海默症,正隨人口老化加速成為挑戰。及早檢測至關重要,有助改善照護規劃、病況追蹤與生活質素;然而,認知衰退常在症狀明顯後才被察覺,因而阻礙了早期介入與支援。
現有診斷工具仍是有限:小型心智狀態檢查(MMSE)等篩查測試可能受到語言、教育程度及文化背景影響;而神經影像檢查及專科評估成本高昂且不普及。因此,語音作為數碼生物標誌物逐漸受到重視。語音反映多種認知歷程,其語言流暢度、停頓模式及發聲上的細微變化,可提供一種無創、可擴展且有助更早檢測認知障礙的方法。理大神經科學及人工智能講座教授梁化樓教授與其研究團隊,在多語言環境下推展相關研究,展示人工智能語音分析如何支援更實用、包容的認知篩查。
這項研究為 INTERSPEECH 2024 TAUKADIAL 挑戰賽的一部分。該挑戰旨在利用自發性語音檢測輕度認知障礙,並預測參與者的認知評分。研究題為 「利用大型語言模型及語音分析進行多語言認知障礙檢測」已刊載於《Brain Sciences》期刊。該挑戰的重要性在於其多語言研究範疇;以往基於語音的失智研究,主要集中於英語數據集,因而尚未確定研究結果是否適用於其他語言及文化。本研究直接回應此不足,同時分析英語及普通話語音,為開發更具全球適用性的認知評估工具作出重要貢獻。
由國際語音交流協會(International Speech Communication Association)主辦的INTERSPEECH 2024 ,是語音科學與技術的重要國際會議,匯聚從事語音處理、人工智能、口語語言系統及相關應用領域的學者和業界專家。該會以挑戰賽項目著稱,透過共同任務及基準數據集,讓研究團隊在透明及一致的條件下互相比較,推動領域進步。其中,TAUKADIAL 挑戰賽聚焦於利用自發性語音進行多語言認知障礙檢測及認知評分預測。
研究數據透過圖片描述任務收集語音數據;此方法常用於認知評估,因能引導受試者產生自然、即興且具結構性的語音表現。每位參與者需描述三幅圖片。研究涵蓋英語及普通話,共有169名參與者,包括輕度認知障礙者及認知正常者;研究在年齡與性別上進行平衡,以降低人口統計變項所致的偏差。研究聚焦兩項主要任務:其一為輕度認知障礙分類(MCI classification),要求模型區分認知健康者與輕度認知障礙者。其二為小型心智狀態檢查(MMSE)評分預測,屬回歸任務,旨在直接根據個人語音估算其認知評分。這兩項任務同時回應認知篩查及病情監測的需求。研究結果顯示,基於語音的人工智能不僅具備二元風險檢測的潛力,亦可支援對認知狀態進行更持續及細緻的評估。
本研究方法以 Whisper 為核心,具體採用 whisper-large-v3 模型作為基礎,從語音中提取聲學特徵。此一方法選擇值得注意:研究團隊並非只依賴傳統人工設計特徵,而是利用Whisper的編碼器,從語音訊號生成1,280維的嵌入向量(embeddings)。這些嵌入向量能提供對錄音內容更豐富的學習式表徵,突顯基礎模型在語音技術中日益重要。這種方法亦顯示,認知評估研究正出現重要轉變:從過去仰賴人工設計的語音指標,逐步轉向利用大型具可轉移性的表徵模型,以捕捉不同語言中細微的聲學模式。
本研究最具啟發性的發現,是評估模型在不同語言間的轉移能力。當研究人員將某一語言訓練的模型直接應用於另一種語言時,模型表現明顯下降。此一發現意義重大:雖然Whisper能夠提供多語言嵌入向量,但用於辨識認知障礙的語音特徵並非完全不受語言影響,仍會受到語音特性、語言結構與文化因素的制約。換言之,多語言能力不能完全取代本地化設計。要在實務上有效部署此類系統,可能需將共享的表徵學習與針對個別語言的調整相結合。
此研究的實際效益亦可從挑戰賽成績得到驗證。在參加INTERSPEECH 2024 TAUKADIAL挑戰賽的所有隊伍中,本研究團隊提出的模型在輕度認知障礙分類中獲得第二名,在小型心智狀態檢查(MMSE)評分預測中獲得第一名。這些名次不僅反映競賽成績,更證明了一套相對簡潔的系統:以自發性語音及聲學嵌入向量為基礎,能在國際基準測試中取得領先表現。因此,本項研究進一步支持語音作為一種具臨床應用潛力且成本較低的數碼生物標誌物。
從更廣泛的角度來看,本研究展望了一個未來:認知篩查可望更頻繁且適合遠距執行,並惠及更多不同語言與文化背景的人群。此工作亦有助界定未來研究方向,包括發展多模態評估方法,將聲學特徵、語言特徵與可能反映認知狀態的非語言行為線索結合起來。
資料來源: Innovation Digest 8