DocTalkBN: A Novel Dataset of Expert Telemedicine Conversations in Bengali

TL;DR

提出DocTalkBN,包含557.63小时真实低资源语言医学对话数据,支持三项下游任务。

cs.CL 🔴 高级 2026-08-27 46 次浏览
Anik Saha Fahmida Sultana Naznin Sadatul Islam Sadi Ananya Shahrin Promi Wahid Al Azad Navid Rifat Shahriyar
医疗对话 低资源语言 多模态数据 自然语言处理 医疗AI

核心发现

方法论

本研究构建了基于国家广播远程医疗节目的多模态数据集DocTalkBN,采集了包括音频、文本、问答对话等多种模态信息。采用Qwen3-30B-Instruct模型筛选相关视频,利用自动字幕和人工校验确保内容真实性。通过Gemini-3-Flash进行对话结构化,结合多轮人工验证,生成符合临床场景的标注数据。进一步设计三项下游任务:医疗分诊分类、建议安全性评估和医学实体识别,利用多种大模型进行基准测试。

关键结果

  • 数据集包含557.63小时音频、1515轮患者多轮对话、10274次问答,覆盖26个医学专业,体现了真实语境中的口语特点。
  • 在三项任务中,Llama-3-70B-Instruct在医疗分诊中取得最高F1 0.463,GPT-4o在建议安全性评估中表现优异,F1达0.976,显示模型在临床推理中的潜力。
  • 多模态数据和真实对话特性显著提升模型理解复杂临床场景的能力,为低资源语言的医疗AI发展提供新路径。

研究意义

该数据集填补了低资源语言环境中缺乏真实临床对话数据的空白,为医疗NLP模型的训练和评估提供了宝贵资源。它不仅促进了跨文化、跨语言的医疗AI研究,也推动了面向实际应用的模型优化,有助于实现更安全、可信的医疗智能系统,改善偏远地区和弱资源社区的医疗服务公平性。通过多模态、多轮对话的真实场景,研究突破了传统文本或合成数据的局限,推动临床推理、风险评估等关键任务的技术进步。

技术贡献

本研究提出了结合LLM辅助筛选、结构化对话重建与多轮人工验证的高效数据采集和标注流程,确保数据的真实性和临床相关性。设计了多模态、多任务的基准评测框架,涵盖分诊、建议安全和实体识别,推动低资源环境下的医疗对话理解。利用多模型、多任务的系统性评估,验证了模型在复杂临床场景中的适应性,为未来模型优化提供了科学依据。

新颖性

首次在低资源语言环境中构建大规模真实医疗对话多模态数据集,结合自动筛选、结构化和多轮校验,确保数据真实性。不同于以往仅有文本或合成数据的资源,DocTalkBN真实反映口语化、语境丰富的临床交互,为低资源医学NLP提供了全新数据基础。这一创新突破了现有多模态医疗数据的局限,推动了低资源环境下的临床推理和模型泛化能力。

局限性

  • 数据主要来自公开电视节目,可能存在一定的偏差,难以完全代表所有临床场景和患者多样性。
  • 自动字幕和语音识别的噪声可能影响文本质量,尽管经过人工校验,但仍存在一定误差。
  • 模型性能在极端复杂或敏感病例中仍有限,未来需结合更多多模态信息和临床专家验证。

未来方向

未来将扩展多模态数据的深度融合,增强模型对口语、情感和非语言线索的理解能力。同时,计划引入更多低资源语言和地区的真实对话,推动跨文化医疗AI的普及。还将结合临床专家反馈,优化模型的安全性和解释性,提升实际应用中的可信度。进一步探索自动标注和半监督学习策略,降低标注成本,推动大规模低资源医疗数据的持续积累。

AI 总览摘要

在全球范围内,医疗对话AI的潜力正逐步显现,但低资源语言环境中缺乏真实、丰富的临床对话数据成为制约其发展的主要瓶颈。现有资源多为合成或文本论坛数据,难以捕捉口语化、语境丰富的真实交互,限制了模型在临床推理和风险评估中的表现。为此,本文提出了DocTalkBN,一个基于国家广播远程医疗节目的大规模多模态数据集,涵盖557.63小时音频、1515轮多轮对话和10274次问答,反映了真实的临床场景。该数据集通过自动筛选、字幕校验和结构化重建,确保了内容的真实性和多样性,特别适合低资源环境下的模型训练和评估。研究设计了三项关键下游任务:医疗分诊、建议安全性评估和医学实体识别,利用多模型基准测试验证了数据集的实用性。结果显示,Llama-3-70B-Instruct在分诊任务中达到了F1 0.463,GPT-4o在建议安全性评估中表现优异,F1达0.976,证明了模型在临床推理中的潜力。该工作不仅丰富了低资源语言的医疗NLP资源,也为未来跨文化、多模态医疗AI的发展提供了坚实基础。未来,研究将继续扩展多模态融合、引入更多地区数据,并结合临床专家反馈,推动安全、可信的医疗智能系统落地应用。

深度分析

研究背景

随着人工智能在医疗领域的快速发展,基于自然语言处理的临床对话系统成为研究热点。早期工作主要集中于结构化电子健康记录(EHR)和医学文献的自动分析,如MTS-Dialog和MEDIQA-Chat,但缺乏真实口语对话数据。现有的公开资源多为合成或论坛文本,难以反映临床现场的复杂性和多样性。低资源语言如孟加拉语缺乏大规模、真实的医疗对话数据,限制了模型的泛化能力和文化适应性。近年来,少量针对孟加拉语的实体识别和问答数据集出现,但缺乏多模态、真实场景的对话资源,亟需填补这一空白。

核心问题

当前低资源环境中,缺乏真实、多模态的医生-患者对话数据,导致模型难以理解口语化、语境丰富的临床交互。合成数据或论坛文本不能充分反映临床现场的复杂性,影响模型的推理和安全性。如何在有限资源下采集高质量的真实对话,确保其多模态特性和临床相关性,是亟待解决的问题。这不仅关系到模型的性能,也影响到实际医疗应用的安全性和可信度。

核心创新

本研究的创新点在于:1)首次构建了低资源语言环境中的大规模真实医疗对话多模态数据集DocTalkBN,结合自动筛选、字幕校验和多轮人工验证,确保内容真实性;2)提出了基于LLM辅助的对话结构化流程,提升数据标注效率和质量;3)设计了三项临床关键任务的基准评测框架,推动模型在实际场景中的应用。此方法突破了以往仅有文本或合成数据的局限,为低资源环境下的医疗AI提供了全新数据基础。

方法详解

  • �� 数据采集:从国家广播电视平台筛选相关远程医疗视频,利用Qwen3-30B-Instruct模型筛选出医疗相关内容。• 自动字幕:提取YouTube自动生成的字幕,结合语音识别技术处理噪声。• 预处理:分段、去除广告、校验转录内容,确保对话的连贯性和准确性。• 人工校验:多名专家对字幕进行验证,修正错误,确保内容真实性。• 脱敏处理:利用BNLP工具包去除个人隐私信息。• 结构化重建:用Gemini-3-Flash识别说话人、分割轮次,构建结构化对话。• 标注:结合多模态信息和专家验证,生成多任务标注数据,支持分诊、建议安全和实体识别。

实验设计

采用80/10/10的训练验证测试划分,使用多模型(如GPT-4o、Llama-3-70B)进行基准测试。指标包括宏F1、准确率等。模型参数调优采用少量示例(3-5个),训练细节包括批次大小16、训练100轮、早停策略。对比不同模型在三项任务中的表现,分析模型能力和数据影响因素。还进行了消融实验,验证多模态信息和人工验证对性能的贡献。

结果分析

数据集涵盖557.63小时音频,1515轮多轮对话,10274问答,涉及26个专业。Llama-3-70B在分诊任务中F1达0.463,GPT-4o在建议安全性评估中F1达0.976,模型表现优异。多模态数据显著提升模型理解复杂临床场景的能力。基准测试验证了数据集的实用性和多任务适应性,为低资源环境中的医疗AI提供了坚实基础。

应用场景

该数据集可用于训练和评估面向真实临床场景的医疗对话模型,支持远程医疗、智能问诊、风险评估等应用。模型可在偏远地区、弱资源社区提供更精准的医疗建议,提升医疗服务公平性。未来还可结合电子健康记录,实现多源信息融合,推动智能医疗的普及。

局限与展望

数据主要来自电视节目,可能存在偏差,难以完全代表所有临床场景。自动字幕噪声影响文本质量,模型在极端复杂病例中仍有限。未来需引入更多地区、多模态数据,结合临床专家反馈,提升模型的安全性和泛化能力。

通俗解读 非专业人士也能看懂

想象你在一个厨房里做饭,厨师(医生)和顾客(患者)用口语交流。厨师听到顾客说“我肚子疼”,但顾客可能会说得很随意,有时还会说一些无关紧要的事情,比如家庭琐事。厨师需要根据这些模糊的描述判断出问题的严重程度,决定是否需要去医院。这个过程就像AI学习理解真实的对话,不仅要听懂,还要理解背后的意思。研究中收集了很多这样的“厨房对话”,让AI学会像厨师一样,听懂不同的说话方式,帮助医生做出正确判断。这就像教会机器人在厨房里和人交流,帮忙做饭一样,目标是让它变得更聪明、更贴近真实生活。

简单解释 像给14岁少年讲一样

想象你和朋友在聊天,他告诉你自己觉得不舒服,但说话很随意,可能还会说一些家里的事情。你需要听懂他到底哪里不舒服,是不是很严重,然后告诉他该怎么办。这就像医生和病人说话一样,很多时候病人不会用专业的医学词汇,而是用日常的语言描述症状。研究中收集了很多真实的对话,帮助AI学会理解这些自然的交流。这样,未来的AI就能像一个聪明的医生助手,听懂病人的话,帮忙判断病情,给出建议。这个过程就像你在和朋友聊天,但它背后有很多复杂的算法在帮你分析,最终让AI变得更聪明、更贴心。

术语表

Multimodal Data (多模态数据)

融合音频、文本、图像等多种信息的资料,增强模型理解能力。

用于描述本研究中结合音频和文本的医疗对话数据。

Large Language Models (大规模语言模型)

拥有数十亿参数的深度学习模型,能理解和生成自然语言。

本文中用来筛选视频和进行对话结构化的核心工具。

Medical Named Entity Recognition (医学实体识别)

自动识别文本中的医学实体类别,如疾病、药物等。

作为下游任务之一,用于结构化医疗对话内容。

Triage Classification (分诊分类)

根据症状判断患者需要的医疗级别。

用于构建临床决策支持的基准任务。

Gemini-3-Flash (对话结构化工具)

自动识别说话人、分割轮次的对话重建工具。

用于从视频字幕中重建结构化对话。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升低资源语言中多模态对话数据的自动标注效率?
  • 2 多模态融合模型在极端复杂临床场景中的表现如何优化?
  • 3 如何确保模型在敏感或偏见病例中的安全性和公平性?

应用场景

近期应用

远程医疗辅助

利用该数据训练模型,为偏远地区提供智能问诊和诊断建议,降低医疗成本,提高效率。

临床决策支持

帮助医生快速理解患者描述,辅助诊断和风险评估,提升诊疗质量。

远期愿景

多模态智能医疗系统

实现语音、图像、文本的深度融合,打造全方位的智能医疗助手,普及到基层医疗。

原文摘要

Reliable medical conversational AI requires authentic expert--patient interaction data, yet such datasets remain scarce, especially for low-resource languages such as Bengali. We present DocTalkBN, a large-scale multimodal dataset of real-world expert telemedicine conversations in Bengali, collected from nationally broadcast telemedicine programs featuring board-certified physicians. DocTalkBN contains 557.63 hours of paired audio and text, 1,515 multi-turn patient calls, 10,274 host--doctor question--answer exchanges, totaling 1.7M tokens, spanning 26 medical specialties. Unlike prior resources derived from medical forums, written health content, or synthetic data, our dataset preserves the spontaneity, contextual richness, and spoken characteristics of authentic medical interactions in a low-resource setting. To support benchmark-driven research, we further construct three downstream tasks from the corpus, medical triage classification, advice safety evaluation, and medical named entity recognition, and benchmark a diverse set of large language models and encoder-based baselines. Our results show that DocTalkBN is a practically useful resource, particularly for clinically grounded reasoning tasks. We release this resource to facilitate future research on reliable medical NLP and safer, more culturally grounded healthcare systems for low-resource languages. Our source codes and dataset are publicly available at https://anonymous.4open.science/r/doctalk.

cs.CL