认知障碍包括轻度认知障碍(MCI)及阿兹海默症,正随人口老化加速成为挑战。及早检测至关重要,有助改善照护规划、病况追踪与生活质素;然而,认知衰退常在症状明显后才被察觉,因而阻碍了早期介入与支援。
现有诊断工具仍是有限:小型心智状态检查(MMSE)等筛查测试可能受到语言、教育程度及文化背景影响;而神经影像检查及专科评估成本高昂且不普及。因此,语音作为数码生物标志物逐渐受到重视。语音反映多种认知历程,其语言流畅度、停顿模式及发声上的细微变化,可提供一种无创、可扩展且有助更早检测认知障碍的方法。理大神经科学及人工智能讲座教授梁化楼教授与其研究团队,在多语言环境下推展相关研究,展示人工智能语音分析如何支援更实用、包容的认知筛查。
这项研究为 INTERSPEECH 2024 TAUKADIAL 挑战赛的一部分。该挑战旨在利用自发性语音检测轻度认知障碍,并预测参与者的认知评分。研究题为 「利用大型语言模型及语音分析进行多语言认知障碍检测」已刊载于《Brain Sciences》期刊。该挑战的重要性在于其多语言研究范畴;以往基于语音的失智研究,主要集中于英语数据集,因而尚未确定研究结果是否适用于其他语言及文化。本研究直接回应此不足,同时分析英语及普通话语音,为开发更具全球适用性的认知评估工具作出重要贡献。
由国际语音交流协会(International Speech Communication Association)主办的INTERSPEECH 2024 ,是语音科学与技术的重要国际会议,汇聚从事语音处理、人工智能、口语语言系统及相关应用领域的学者和业界专家。该会以挑战赛项目着称,透过共同任务及基准数据集,让研究团队在透明及一致的条件下互相比较,推动领域进步。其中,TAUKADIAL 挑战赛聚焦于利用自发性语音进行多语言认知障碍检测及认知评分预测。
研究数据透过图片描述任务收集语音数据;此方法常用于认知评估,因能引导受试者产生自然、即兴且具结构性的语音表现。每位参与者需描述三幅图片。研究涵盖英语及普通话,共有169名参与者,包括轻度认知障碍者及认知正常者;研究在年龄与性别上进行平衡,以降低人口统计变项所致的偏差。研究聚焦两项主要任务:其一为轻度认知障碍分类(MCI classification),要求模型区分认知健康者与轻度认知障碍者。其二为小型心智状态检查(MMSE)评分预测,属回归任务,旨在直接根据个人语音估算其认知评分。这两项任务同时回应认知筛查及病情监测的需求。研究结果显示,基于语音的人工智能不仅具备二元风险检测的潜力,亦可支援对认知状态进行更持续及细致的评估。
本研究方法以 Whisper 为核心,具体采用 whisper-large-v3 模型作为基础,从语音中提取声学特征。此一方法选择值得注意:研究团队并非只依赖传统人工设计特征,而是利用Whisper的编码器,从语音讯号生成1,280维的嵌入向量(embeddings)。这些嵌入向量能提供对录音内容更丰富的学习式表征,突显基础模型在语音技术中日益重要。这种方法亦显示,认知评估研究正出现重要转变:从过去仰赖人工设计的语音指标,逐步转向利用大型具可转移性的表征模型,以捕捉不同语言中细微的声学模式。
本研究最具启发性的发现,是评估模型在不同语言间的转移能力。当研究人员将某一语言训练的模型直接应用于另一种语言时,模型表现明显下降。此一发现意义重大:虽然Whisper能够提供多语言嵌入向量,但用于辨识认知障碍的语音特征并非完全不受语言影响,仍会受到语音特性、语言结构与文化因素的制约。换言之,多语言能力不能完全取代本地化设计。要在实务上有效部署此类系统,可能需将共享的表征学习与针对个别语言的调整相结合。
此研究的实际效益亦可从挑战赛成绩得到验证。在参加INTERSPEECH 2024 TAUKADIAL挑战赛的所有队伍中,本研究团队提出的模型在轻度认知障碍分类中获得第二名,在小型心智状态检查(MMSE)评分预测中获得第一名。这些名次不仅反映竞赛成绩,更证明了一套相对简洁的系统:以自发性语音及声学嵌入向量为基础,能在国际基准测试中取得领先表现。因此,本项研究进一步支持语音作为一种具临床应用潜力且成本较低的数码生物标志物。
从更广泛的角度来看,本研究展望了一个未来:认知筛查可望更频繁且适合远距执行,并惠及更多不同语言与文化背景的人群。此工作亦有助界定未来研究方向,包括发展多模态评估方法,将声学特征、语言特征与可能反映认知状态的非语言行为线索结合起来。
资料来源: Innovation Digest 8