Collaboration with Conversational AI Assistants for UX Evaluation: Questions and How to Ask them (Voice vs. Text)

TL;DR

Wizard-of-Oz研究20人、325个问题:文字助手提问更多且效率更高,满意度与信任度相当。

cs.HC 🟡 进阶级 2023-03-07 21 次浏览
Emily Kuang Ehsan Jahangirzadeh Soure Mingming Fan Jian Zhao Kristen Shinohara
用户体验评估 对话式人工智能 Wizard-of-Oz 语音交互 可用性测试

核心发现

方法论

研究采用Wizard-of-Oz设计探针,以React、Socket.IO和Node.js构建模拟对话助手。20名参与者分别通过文字或语音界面观看可用性测试录像,并自由提问;研究者后台模拟AI回答。研究对共325个问题进行编码,归纳问题类型,并比较两种模态的提问数量、长度及满意度、效率和信任评价。

关键结果

  • 325个问题被归为五类:用户行动、用户心智模型、请求AI帮助、产品与任务信息、用户人口统计信息,说明评估者需要的不只是自动标注,还包括解释、推断与任务背景。
  • 文字组提出的问题数量更多,但语音与文字问题长度没有显著差异;这反驳了“语音必然产生更长、更自然问题”的简单预期。
  • 文字助手被认为显著更高效;然而两组在满意度和信任度上的评价相当,表明效率优势并未自动转化为更高的总体接受度。

研究意义

论文将UX评估从“被动查看AI可视化”推进到“主动询问AI”。它回应了录像分析耗时、资源有限以及评估者效应等长期问题,也说明对话系统必须支持评估者的判断过程,而非仅输出结论。研究为学术界提供了325条真实分析问题数据,为工业界设计可追问、可解释、按需提供信息的UX工具提供需求依据。

技术贡献

主要贡献不是提出新的识别算法,而是建立了面向UX分析的对话需求分类框架和模态比较证据。系统整合视频播放器、聊天线程、Web Speech API语音识别与文字/语音双通道回答,形成可复用的交互探针。该设计揭示了多模态录像信息如何通过自然语言问答被调用,并提出合并多段录像分析、支持用户选择文字或语音等工程方向。

新颖性

相较于UserTesting的情感分析、UXTesting的情绪检测及既有ML可视化工具,本研究首次系统刻画评估者在UX录像分析中主动向对话助手提出的问题范围,并直接比较文字和语音模态。其核心新意在于把“信息需求”而非“模型输出”作为交互设计起点。

局限性

  • Wizard-of-Oz助手由研究者模拟,回答准确性、延迟和错误恢复未被真实AI系统验证,因此不能直接推断部署后的体验。
  • 样本仅20人,且研究以单一实验界面和可用性录像为基础;不同专业水平、语言、任务复杂度及真实工作压力可能产生不同提问模式。
  • 论文报告模态差异,但摘要未提供完整统计量、效应量或逐类频数,结果解释仍需结合全文数据表。

未来方向

未来应实现能够处理视觉、音频、文本和交互日志的真实助手,检验答案准确性、可解释性与幻觉风险;同时扩大跨行业、跨语言样本,比较混合模态和上下文感知交互,并研究如何自动合并多名评估者及多段录像的分析。

AI 总览摘要

可用性测试能揭示产品问题,但分析录像往往要求评估者同时观察画面、声音、操作和言语,过程缓慢且容易遗漏。传统AI工具通常以预设可视化直接展示情感、情绪或交互线索,评估者却不能针对某个瞬间追问“用户为何这样做”或“这个判断依据是什么”。

Kuang等人在CHI ’23中采用Wizard-of-Oz设计探针,让20名参与者使用模拟文字或语音助手分析录像,并自由提出问题。研究者共收集325个问题,归纳出用户行动、用户心智模型、AI帮助、产品与任务信息、用户人口统计五类需求。文字界面由React、Socket.IO和Node.js实现;语音界面使用Web Speech API进行语音转写,并以文字和语音双重方式回答。

文字组提问更多,问题长度却与语音组相近;文字助手在效率上显著更受认可,但两组满意度和信任度相当。研究的重要启示是:UX助手不应只“推送”模型检测结果,还应成为可追问的分析伙伴。未来系统需要整合多段录像、提供证据与解释,并允许评估者按情境选择文字、语音或混合交互。由于助手是人工模拟且样本较小,论文更像需求地图,而不是对真实AI性能的最终验证。

深度分析

研究背景

可用性测试是发现数字产品问题的常用方法,但人工分析需同步处理视频、音频和笔记。团队协作可提高完整性,却成本高;279名UX评估者中仅37%报告会协作。既有机器学习方法可从交互事件、声学和视觉信号中检测线索,但不能覆盖人工推理所发现的全部问题。UserTesting的情感分析、UXTesting的情绪检测及ML可视化工具也多为单向输出。

核心问题

核心问题是:评估者在分析录像时究竟想向AI询问什么,以及文字和语音是否导致不同的提问行为与体验。难点在于UX判断不仅依赖可观察动作,还涉及用户意图、心智模型、语气、任务背景和产品知识;系统既要提供及时信息,又不能以无关预设结果打断分析。

核心创新

研究把对话问答引入UX录像评估,并以开放式设计探针而非预先限定任务来发现需求。第一,建立五类问题框架;第二,在同一视频分析情境下比较文字与语音;第三,将界面设计为视频播放器加折叠聊天窗口,减少干扰;第四,语音回答同时显示文字,允许静音。贡献重点是交互需求与设计原则,而非新的分类器。

方法详解

  • ��参与者:20人使用模拟助手分析可用性测试录像。
  • ��文字条件:React前端中的聊天框接收问题,答案显示在聊天线程。
  • ��语音条件:通过“Hey UX assistant”或麦克风按钮提问;Web Speech API负责语音转写,回答以文字和女性声线播放。
  • ��交互机制:开启麦克风或播放回答时自动暂停视频,提供脉冲光环反馈,并允许静音。
  • ��分析方法:研究者记录并编码325个问题,归纳五类信息需求,比较提问数量与长度,并分析问卷和访谈中的效率、满意度和信任评价。

实验设计

这是经验性设计探针,不是模型基准实验。实验条件为文字助手与语音助手;两者共享视频播放器和聊天结构,仅输入输出模态不同。主要观测指标包括问题总数、问题长度、问题内容类别,以及参与者对效率、满意度和信任的主观评价。论文没有使用公开数据集、训练算法或与准确率相关的baseline;后台由研究者模拟AI回答,以隔离交互需求。

结果分析

325个问题显示,评估者关注五类信息,范围从可见用户行动扩展到不可直接观察的心智模型和AI建议。文字条件提问更多,说明打字可能更适合连续、低干扰的分析;但两组问题长度相近,语音并未产生预期的更长表达。文字助手效率评价显著更高,而满意度和信任度没有显著模态差异,体现效率、自然性与社会接受度之间的分离。

应用场景

UX研究团队可用对话助手快速查询某个时间点的用户操作、言语线索和任务背景,并要求系统给出证据或解释。产品团队可将其连接到视频、转写、点击日志和人口统计资料,辅助整理问题清单。实际部署前需要可靠的多模态识别、时间戳引用、权限管理、隐私保护及人工复核流程。

局限与展望

研究使用Wizard-of-Oz模拟,无法检验真实模型的识别错误、幻觉、响应延迟和扩展成本;20人样本及单一界面也限制了外部效度。语音输入还受到麦克风权限、浏览器和环境噪声影响。未来应在真实项目中比较混合模态,报告完整统计量与效应量,测试不同专业群体,并研究跨录像汇总、答案可追溯和不确定性表达。

通俗解读 非专业人士也能看懂

把UX评估想成侦探看监控录像。传统工具像一块自动贴满便利贴的墙:它会把可能的情绪、动作或异常全部标出来,但侦探不能对某张便利贴追问“你为什么这么判断?”于是很多线索仍要自己倒带、比较和推理。

这项研究让侦探身边坐着一位助手。侦探可以打字或说:“用户刚才找按钮时在想什么?”“他是否得到帮助?”“这个任务的要求是什么?”研究者先假装助手回答,观察大家真正会问什么。20人一共提出325个问题,主要围绕用户做了什么、用户怎么理解、希望助手帮什么、产品和任务是什么,以及用户是谁。

打字组问得更多,问题长短却差不多;他们觉得打字更省时间,但对两种方式的满意度和信任度相近。换句话说,语音不一定更方便,打字也不一定更亲切。最重要的启示是:好助手不应不停往墙上贴信息,而应等侦探需要时回答,并说明证据来自录像的哪个位置。

简单解释 像给14岁少年讲一样

想象你在看一段游戏录像,任务是找出玩家为什么总在同一个菜单迷路。你可以自己反复暂停、倒带,还要听他说了什么、看手指点了哪里,真的很累!如果旁边有一个AI队友,你就能问:“他刚刚想找什么?”或者“这个按钮是不是让他误解了?”

这篇论文没有马上造出完美AI,而是用了Wizard-of-Oz方法:参与者以为在和AI聊天,其实研究者在幕后回答。20个人分别用打字或说话来提问,总共留下325个问题。问题大致分成五种:玩家做了什么、他脑子里怎么理解、希望AI帮什么、产品和任务的信息,以及玩家的基本资料。

结果有点出人意料!打字的人问得更多,但每个问题并没有明显更长。他们觉得打字更有效率,可是说话和打字在满意度、信任感上打成平手。也就是说,语音听起来像聊天,不代表做分析一定更快。

未来的UX助手就像一个很聪明的录像搭档:能看画面、听声音、读文字,还能指出证据在哪里;你想打字、说话,甚至混合使用都可以。不过它必须诚实说明“不确定”,否则一个自信但错误的答案,可能把整个产品判断带偏!

术语表

Wizard-of-Oz(绿野仙踪实验法)

参与者以为系统由自动AI运行,实际上由研究者在幕后模拟。它适合在技术尚未成熟时研究用户需求和交互行为。

论文用它模拟文字和语音UX助手,避免先解决复杂的录像理解问题。

Conversational AI assistant(对话式AI助手)

通过自然语言与用户往返交流,并按需提供信息或建议的系统。它强调动态问答,而非单向展示结果。

论文将其设想为UX评估者的分析协作者。

UX evaluation(用户体验评估)

系统地判断产品是否易用、可理解且符合用户目标的过程。可用性测试录像是其中的重要证据来源。

参与者围绕录像向助手提问。

User mental model(用户心智模型)

用户对产品如何工作、按钮意味着什么以及下一步会发生什么的内部理解。它通常不能直接观察,只能由行为和语言推断。

五类问题之一,体现评估者对意图和误解的关注。

Web Speech API

浏览器提供的语音识别与语音合成接口,可把说话转成文字或播放语音。实际能力取决于设备、浏览器和环境。

语音条件使用它完成提问转写。

Evaluator effect(评估者效应)

不同评估者观察同一录像时,可能发现不同问题的现象。协作通常能降低这种差异并提高覆盖面。

论文将对话助手视为低成本协作伙伴。

开放问题 这项研究留下的未解疑问

  • 1 真实AI能否准确回答心智模型问题仍未知;需要带时间戳证据、置信度和人工核验的多模态系统测试。
  • 2 不同文化、语言和专业经验是否改变提问类别及对语音的偏好,20人研究无法回答,需要更大规模跨场景研究。
  • 3 助手如何合并多名评估者和多段录像、避免重复或冲突结论,仍缺乏成熟交互与评价指标。

应用场景

近期应用

录像问答辅助

UX评估者在观看测试录像时,用文字或语音询问用户动作、言语、任务进展及可能原因。系统应返回对应时间戳、原始片段和不确定性,帮助研究者减少倒带与手工检索。

分析线索整理

产品团队可让助手把问题按用户行动、心智模型、产品信息等类别归档,并生成待人工确认的问题清单。部署前应连接转写、交互日志和权限系统,避免把推测当成事实。

远期愿景

多评估者协作平台

未来助手可汇总多名评估者、多段录像及多模态信号,自动发现共识和分歧,再让人审查证据。这可能降低团队协作成本,但必须解决隐私、偏差、可追溯性和错误传播问题。

原文摘要

AI is promising in assisting UX evaluators with analyzing usability tests, but its judgments are typically presented as non-interactive visualizations. Evaluators may have questions about test recordings, but have no way of asking them. Interactive conversational assistants provide a Q&A dynamic that may improve analysis efficiency and evaluator autonomy. To understand the full range of analysis-related questions, we conducted a Wizard-of-Oz design probe study with 20 participants who interacted with simulated AI assistants via text or voice. We found that participants asked for five categories of information: user actions, user mental model, help from the AI assistant, product and task information, and user demographics. Those who used the text assistant asked more questions, but the question lengths were similar. The text assistant was perceived as significantly more efficient, but both were rated equally in satisfaction and trust. We also provide design considerations for future conversational AI assistants for UX evaluation.

cs.HC cs.AI