夜雨聆风学习资料网

ARTICLE · 1112144

论文随笔: 出门前先让 AI"踩点":Accessibility Scout,给轮椅用户定制的无障碍侦察兵

论文随笔: 出门前先让 AI"踩点":Accessibility Scout,给轮椅用户定制的无障碍侦察兵

轮椅用户用手机拍摄咖啡馆入口

对行动不便的人来说,出一次远门,出发前的功课可能比旅行本身还累。订酒店要一封封邮件确认卫生间门够不够宽;查餐厅要翻遍点评看有没有台阶;哪怕做足了功课,到了现场还是可能傻眼。一位坐轮椅的受访者说得很直白:"就算我做了所有调查,到了那儿,它还是可能一团糟。"

美国 CDC 的数据是 12.2% 的成年人有行动障碍,而且几乎每个人老了都会遇到类似问题。但现有的无障碍评估工具,要么靠人工 checklist(比如 ADA 建筑规范),要么是自动化的固定项检测——它们回答的都是"这个地方对'残疾人'友好吗",却回答不了"这个地方对'我'友好吗"。坐轮椅和拄拐杖的人,怕的东西根本不一样;同一个人,去约会和去住酒店,关心的也不一样。

UIST 2025 上的 Accessibility Scout 就是来解决这个问题的:一个基于大语言模型的"无障碍侦察兵"。你扔给它一张环境照片(Yelp、Google 地图、Airbnb 上的都行),再告诉它你的身体状况,它就能标出针对你个人的无障碍隐患。

Accessibility Scout 概念图:左侧是三位不同行动能力用户的画像,右侧系统为他们生成的个性化无障碍扫描结果

核心洞察:无障碍不是"达标",而是"我能不能完成我想做的事"

传统做法是把无障碍做成一张静态清单:门宽有没有 80 厘米、有没有坡道。Accessibility Scout 换了个视角——从"任务"出发。同样一张咖啡馆的照片,如果你是去约会,系统会拆解出"进门、点单、坐下、聊天、去洗手间"等一系列子任务,再细化到"抓握杯子""从椅子上站起来"这样的基本动作,然后逐个判断环境里有什么会妨碍你。

这套"任务—子任务—基本动作"的拆解,恰好模仿了受访者在形成性研究里真实评估环境时的思考方式。6 位轮椅用户在访谈里反复强调:脱离具体任务谈无障碍是没有意义的。"这地方是要长住还是短住?要求完全不一样。"

任务拆解示例:去咖啡馆约会,被拆解为如厕、用餐、交谈等子任务,再细化到抓握、行走等基本作

这 6 位用户的访谈,还沉淀出四条设计原则,我觉得对做任何 AI 辅助工具的人都有参考价值:D1,模拟人评估环境时的思路(按任务拆解,而不是按清单打勾);D2,让用户能验证和修正 AI 的输出——控制权必须在人手里;D3,用"任务完成度"的语言说话("你坐不下这张椅子"比"椅子高度 45cm"有用);D4,解释要直指"为什么这是个问题",而且要跟用户自己的身体状况挂钩。Accessibility Scout 的整条流水线,就是照着这四条搭的。

它是怎么做到的:给 AI 建一本"关于你的档案"

系统的巧妙之处在于用户模型。它不是简单存一句"我坐轮椅",而是一份结构化的 JSON 档案,记录你做的每个动作、哪里受影响、做得频不频繁。比如:

{  "name": "Walking",  "desc": "短距离拄拐杖,长距离用轮椅",  "frequent":true,  "affected_part": "legs"}

这份档案可以通过三种方式建立和更新:① 你直接用文字描述自己的情况,LLM 帮你拆解成条目;② 你在照片上手动标注隐患,系统从标注里反推你的需求;③ 最常用的——对 AI 生成的结果点评,比如"你说这条路不窄,我觉得还行",系统就把这条反馈吃进去,更新档案。用得越多,它越懂你。

系统界面:查看全部隐患、逐条反馈修正、手动补充新隐患、更新用户模型(论文原图)

拿到照片和用户模型后,扫描分四步走:先识别你可能在这儿做的任务;用 Semantic-SAM 做语义分割并编号(Set-of-Mark prompting,让 LLM 能指着图里具体区域说话);每个任务并行调用 LLM 找隐患;最后用 Sentence-BERT 把重复的隐患合并(相似度超过 0.7 就算同一条)。整个流程被设计得可解释——每条隐患都能追溯到"因为你要做 X,而你的 Y 能力受限",用户看得懂,才敢信。

Accessibility Scout 系统结构:环境评估与用户建模两大流水线,通过用反馈持续更新

通用版 vs 定制版:差别有多大?

论文里最直观的一张对比图,左边是"通用模式"给一位用户(U3,轮椅+拐杖)的厨房扫描,右边是"个性化模式"给另一位用户(U6)的健身房扫描。通用版只会说"橱柜太高"这种放之四海皆准的话;个性化版能指出"杠铃片放在高处,手臂活动受限的人够不着"——U3 看了直呼:"它居然提到了轮椅和拐杖,太难得了,通常只提轮椅!"

通用 LLM 标注与个性化标注的对比:个性化版本能捕捉到针对个人行动能力的具体隐患

技术评估的规模不小:500 张真实环境照片(来自美国 9 个城市的 Google 地图和 Yelp),11 套用户模型,一共跑出 5500 次扫描、39394 条隐患。研究者人工抽查了 3590 条,发现 6.63% 是"幻觉"——图里根本没有的东西(比如把不存在的收银台标出来)。成本也很实在:平均一张图 8758 个 token,约 2 美分,10 秒出结果,理论上每分钟能扫 3500 张图。

18 个真实场景的隐患标注示例:从高低不平的桌面、昏暗灯光到缺失的扶手,橙色为 AI 出的隐患区域

"个性化"是可以被量化的。 研究者用 Wasserstein 距离衡量了不同用户模型产出的隐患分布差异:差异最大的是 P4(没有确诊残疾,只是偶尔需要帮助)和 P5(用助行器)——一个几乎不需要无障碍考虑,一个处处需要。论文里把 11 个用户的差异画成热力图,直观地证明了一件事:不存在"平均用户",只有具体的人。这也是为什么固定清单注定不够用。

11 位用户隐患分布的雷达图对比(左)与用户间 Wasserstein 距离热力图(右:不存在“平均用户”,只有具体的人(论文原图)

个性化到底有没有用?10 位行动能力各异的参与者做了盲测:同一批照片,一半隐患来自通用模型,一半来自训练过的个人模型,打乱后让他们按 7 分制打分。结果:个性化模型独有的隐患平均 4.68 分,通用版只有 3.35 分(p<0.001,差异显著)。一位四肢瘫痪、用电动轮椅的参与者(P8)说得毫不客气:通用版的结果"我看了只想笑,看完就忘";个性化的"很多都非常有用"。另一位说,个性化最大的好处是帮他过滤噪音:"信息少了,不用自己费劲筛。"

盲测实验界面:同一张照片,通用版(蓝)与个性化版(绿/橙)的隐患描述被打乱后请用户打分

还有个有意思的发现:系统挖出了两类超出 ADA 规范的隐患聚类——"电视/遥控器"和"噪音"。比如"卧室里有电视,对讨厌分心的人是干扰""临街太吵,听力不好的人没法正常聊天"。ADA 清单里根本没有这些,但对某些人来说,这就是决定去不去的理由。这正是"个人"二字的价值:标准只能保下限,体验需要定制。

诚实的一面:AI 也会犯错,而且人知道

研究者没有回避问题。用户反馈里,被提得最多的改进点是:视觉高亮有时标不准,反而分散注意力;隐患描述可以更简洁("我不需要读大段文字,标出来就行");偶尔重复。也有人提醒:别替我下结论——"你说楼梯'会让我疲劳',这话太武断了,别帮我做判断。"

但整个设计里最打动人的一点,是它对"人机关系"的定位。形成性研究里定下的四条设计原则,第二条就是"让人管得住 AI":所有 AI 生成的隐患,用户都能复核、修改、补充。一位参与者说:"能亲手把我的意见加进去、亲眼看到它变了,这太重要了——我在掌控。"另一位在训练时玩得不亦乐乎:"这太好玩了,我太喜欢了。"这种"越用越懂我"的感觉,正是个性化系统最难复制的护城河。当 AI 犯错不可避免时,让用户能看懂、能纠正,比把准确率再提高一个百分点更实在。

这意味着什么

Accessibility Scout 的野心不只是做个工具。它指向一种新的基础设施想象:把全网的环境照片(Airbnb、Yelp、Google 地图)变成可查询的无障碍数据库。订房前扫一眼,约会前看一下,甚至房东可以用它来判断"把家具挪一挪,能不能接待某类客人"。

未来的使用场景:订酒店前先让 AI 扫一眼房间照片,无障碍情况一目了然

论文里还提到了几个让我印象深刻的用法:有人把它当"赛前侦察报告"——"提前拿到侦察报告,就能避开第一次去陌生地方的焦虑";有人想用它分享自己的生活经验——把"坐轮椅出门是什么感觉"这种很难讲清楚的事,变成一张图发给家人朋友,换来理解;还有人想到政府可以用它批量评估公租房对特定人群的友好度。从"帮我一个人出门",到"帮一类人被看见",这条路是通的。

更深一层,它在回答一个问题:AI 时代的无障碍,到底应该是"一套标准管所有人",还是"每个人都有一份自己的说明书"?论文的答案很明确——后者。一位参与者的话可以作为注脚:"用户立刻就觉得自己有发言权、被听见了——'嘿,这是我的困扰'。这太酷了。"

技术向来不只是效率工具。对 12.2% 的人来说,"提前知道"和"到了才知道"之间,差的可能是一次愉快的约会,还是一次狼狈的折返。Accessibility Scout 想做的,就是把这种不确定性,提前变成一张清晰的地图。


参考:Huang et al., Accessibility Scout: Personalized Accessibility Scans of Built Environments, UIST '25. DOI: 10.1145/3746059.3747624

相关学习资料