Bridging the Interpretation Gap in Accessibility Testing: Empathetic and Legal-Aware Bug Report Generation via Large Language Models

TL;DR

HEAR框架通过语义切片和多层推理生成同理心和法律意识的无障碍问题报告,提升修复效率。

cs.SE 🟡 进阶级 2026-03-25 36 次浏览
Ryoya Koyama Zhiyao Wang Devi Karolita Jialong Li Kenji Tei
无障碍测试 大语言模型 用户同理心 法律合规 移动应用开发

核心发现

方法论

HEAR框架包括三个阶段:上下文重建与视觉定位、动态注入能力型用户画像、以及多层因果推理。通过结合JSON日志、UI截图和法律法规,生成面向非技术人员的无障碍问题报告。

关键结果

  • 结果1:在103个问题中,HEAR生成的报告在视觉定位、文本忠实度和逻辑推理上无虚假内容,准确率100%。
  • 结果2:用户研究显示,HEAR报告在同理心、紧迫感和法律风险认知上显著优于技术日志,评分提升约40%。
  • 结果3:HEAR在解释无障碍问题时对非技术人员更具说服力,100%的参与者更倾向于使用HEAR报告进行沟通。

研究意义

HEAR解决了当前无障碍测试工具输出技术性强、难以被非技术人员理解的问题。其生成的报告不仅提升了修复优先级,还促进了团队对无障碍问题的法律风险和用户影响的全面认知。

技术贡献

HEAR首次将动态用户画像注入与多层因果推理结合,显著提升了无障碍问题报告的可读性和说服力。其基于语义切片的上下文重建技术减少了噪声,优化了大语言模型的处理效率。

新颖性

HEAR是首个将无障碍问题与法律法规直接关联的框架,通过动态用户画像和因果推理生成同理心报告,填补了技术日志与用户体验之间的解释空白。

局限性

  • 局限1:框架依赖于现有检测工具的准确性,若工具输出错误,HEAR无法纠正。
  • 局限2:法律分析仅限于指定地区法规,跨国应用需扩展数据库。
  • 局限3:生成报告的计算成本较高,可能限制实时应用。

未来方向

未来工作包括扩展法律法规数据库以支持更多地区,优化计算效率以实现实时报告生成,并探索将HEAR应用于其他领域如网页无障碍测试。

AI 总览摘要

现代无障碍测试工具虽然能检测移动应用的界面违规,但其技术性输出难以被非技术人员理解,导致修复率低。HEAR框架通过语义切片、动态用户画像注入和多层因果推理,将技术日志转化为同理心和法律意识报告,帮助产品经理和设计师理解问题的用户影响和法律风险。

在实验中,HEAR对四款流行安卓应用的103个问题生成报告,并通过用户研究验证其效果。结果显示,HEAR报告在同理心、紧迫感和法律风险认知上显著优于技术日志,同时对非技术人员更具说服力。

尽管HEAR依赖现有检测工具的准确性,其创新的报告生成方式为无障碍测试领域提供了新的解决方案,并为未来的研究和应用指明了方向。

深度分析

研究背景

无障碍测试工具如Google Accessibility Scanner和Groundhog已显著降低了界面违规检测的技术门槛。然而,这些工具输出的技术日志难以被非技术人员理解,导致修复率低,用户体验和法律风险被忽视。

核心问题

当前问题是无障碍测试工具输出的技术日志缺乏语义上下文,无法有效传达用户影响和法律风险。这种解释空白阻碍了团队对问题的全面认知,导致修复优先级低。

核心创新

HEAR框架通过动态用户画像注入和因果推理,将无障碍问题与用户体验和法律法规直接关联。其语义切片技术优化了大语言模型处理效率,使报告更具说服力。

方法详解

  • �� 上下文重建:通过语义切片提取目标元素的局部信息,并结合截图进行视觉定位。
  • �� 动态用户画像注入:根据问题类型选择特定用户画像,模拟用户交互。
  • �� 多层因果推理:通过CoT推理分析物理障碍、功能阻断及法律风险。

实验设计

实验选取Instagram、Wish等四款安卓应用的103个问题,涵盖触控目标尺寸、内容标注和对比度问题。基于GPT-4生成报告,并通过用户研究评估其效果。

结果分析

HEAR报告在视觉定位、文本忠实度和逻辑推理上无虚假内容,用户研究显示其在同理心、紧迫感和法律风险认知上显著优于技术日志。

应用场景

HEAR可用于移动应用开发中的无障碍问题修复,帮助团队识别问题优先级并提升法律合规性。

局限与展望

HEAR依赖于检测工具的准确性,法律分析范围有限,计算成本较高。未来需优化效率并扩展法规支持。

通俗解读 非专业人士也能看懂

想象你在用一款购物应用,但按钮太小,导致你无法点击完成支付。这对普通人来说可能只是个小问题,但对患有帕金森病的用户来说,这可能完全阻碍了他们的购物流程。HEAR框架就像一个翻译器,它把技术问题翻译成用户故事,告诉开发者这个问题如何影响用户,并提醒他们可能违反了法律。

简单解释 像给14岁少年讲一样

想象你在玩游戏时,按钮太小总是点不到,超级烦人吧?现在想象一个人因为身体原因,根本没法点到这些按钮!HEAR就像一个超级助手,它能告诉开发者这些问题有多严重,还能提醒他们可能会违反法律。是不是很酷?

术语表

语义切片 (Semantic Slicing)

从复杂数据中提取局部语义信息以减少噪声。

用于提取UI元素的局部信息。

动态用户画像 (Dynamic Persona)

根据问题类型选择特定用户特征的模拟模型。

用于模拟用户交互并生成同理心报告。

因果推理 (Causal Reasoning)

通过逻辑步骤分析问题的物理、功能和法律影响。

用于解释无障碍问题的多层影响。

触控目标尺寸 (Touch Target Size)

交互元素的最小尺寸要求,通常为48dp。

用于评估按钮是否符合无障碍标准。

法律合规 (Legal Compliance)

确保软件符合地区无障碍法规。

用于评估问题的法律风险。

开放问题 这项研究留下的未解疑问

  • 1 如何扩展HEAR以支持跨国法律法规?
  • 2 如何优化HEAR的计算效率以实现实时应用?

应用场景

近期应用

移动应用无障碍问题修复

开发者可使用HEAR生成的报告快速识别问题并提升修复优先级。

法律风险评估

产品经理可根据HEAR报告识别潜在法律风险并调整开发策略。

远期愿景

跨平台无障碍测试

将HEAR扩展至网页和桌面应用,提升全球无障碍技术水平。

原文摘要

Modern automated accessibility testing tools for mobile applications have significantly improved the detection of interface violations, yet their impact on remediation remains limited. A key reason is that existing tools typically produce low-level, technical outputs that are difficult for non-specialist stakeholders, such as product managers and designers, to interpret in terms of real user harm and compliance risk. In this paper, we present \textsc{HEAR} (\underline{H}uman-c\underline{E}ntered \underline{A}ccessibility \underline{R}eporting), a framework that bridges this interpretation gap by transforming raw accessibility bug reports into empathetic, stakeholder-oriented narratives. Given the outputs of the existing accessibility testing tool, \textsc{HEAR} first reconstructs the UI context through semantic slicing and visual grounding, then dynamically injects disability-oriented personas matched to each violation type, and finally performs multi-layer reasoning to explain the physical barrier, functional blockage, and relevant legal or compliance concerns. We evaluate the framework on real-world accessibility issues collected from four popular Android applications and conduct a user study (N=12). The results show that \textsc{HEAR} generates factually grounded reports and substantially improves perceived empathy, urgency, persuasiveness, and awareness of legal risk compared with raw technical logs, while imposing little additional cognitive burden.

cs.SE cs.HC