Draft · UX Audit Agent · 内部讨论稿

Tapo 设备 Onboarding
UX Audit 评审框架 v1 提案

从 PM / 测试的 4 类 12 项,到「旅程阶段 × 质量原则」矩阵;并定义每个维度的四级成功标准

UX Team · 2026-09-04 · 信源:内部 Confluence 4 页 + 外部 10 项一手来源,全部可回溯

00 · 这份 deck 讲什么

四个部分

01

内部起点

PM / 测试已有的框架、20 条共性问题、663 单工单数据 → v0 标准

02

外部对照

NN/g、Dartmouth、IEEE、Matter、Amazon FFS、Apple HIG、ISO 9241-110 → 12 个缺口

03

v1 框架

7 阶段 × 8 原则矩阵,v0 的 35 条 + 新 21 条全部落格

04

怎么定标准

维度制定 5 步法、四级成功标准、严重度、打分汇总、报告结构

引用代号:S1 OB优化框架 · S2 OB安装问题专项 · S3 OB优化-技术支持反馈 · S4 OB优化-汇报思路(内部,E4);X1–X10 外部来源(附录页)

01 · 内部起点

PM 侧已有一套「4 类 × 12 评估项」,7 月已用于汇报

目标句(S4 原文):让用户从「打开 App」到「绑定成功」,每一步都走得通、走得快、看得懂、心里有底

可用性 · 走得通
  • 起点可达 前置条件是否足够
  • 路径可通 异常能否自动兜底
  • 异常可重来 兜不住是否可重来
效率类 · 走得快
  • 步骤够少 操作步骤能否压缩
  • 等待够短 响应 / 感知能否更快
  • 不重复 已知信息能否复用
易用性 · 看得懂
  • 看得懂 信息呈现是否清晰
  • 不用选 系统能否替用户判断
  • 接得上 中断后能否续上
情感类 · 心里有底
  • 确定感 知道在哪、还要多久
  • 安全感 失败有没有人兜底
  • 信任感 产品和品牌靠谱

来源:S1「三、问题归类 - 外部」评估项 / 评估要点原文(Emma,v14,2026-07-21);S2 测试部 20 条共性问题含研发评估结论(v30,2026-07-01)

01 · 内部起点

工单告诉我们卡点在哪:连接与入网阶段占了绝大多数

S3 · Tapo Cam · UK · 邮件 + App 渠道 · 2026-04-01~07-01 · 663 单,其中首次配置咨询 75%

④ Camera 连不上路由器
73 · 14.7%
① 不会开始(App 操作困惑)
63 · 12.7%
⑤ WiFi 已连但配对失败
63 · 12.7%
② 找不到 SoftAP 信号
14 · 2.8%
③ 连不上 SoftAP
9 · 1.8%

换网是常见场景

更换路由器 / 网络后重连失败;App 静默沿用旧 WiFi 凭据是「换网陷阱」(S3 结论 1、2c)

配对状态不清晰

「pairing failed」可能是 App 未及时发现设备,也可能是设备连路由器超时,用户反复重试(S3 结论 3)

进 App 前就卡

iOS 本地网络权限 FAQ 363 被忽略;SN 在 App 内查不到,室外机要爬梯子看标贴(S3 FAQ 频次)

01 · 内部起点

v0 标准:继承 4 类 12 项,落成 35 条检查点

结构

  • 顶层 4 类 ← S4 目标句
  • 中层 12 评估项 ← S1 原表
  • 底层 35 检查点,每条带 S1–S3 引用到具体条目

四态 + 一锁

  • ✅ 通过 · ⚠️ 部分 · ❌ 不通过 · ➖ 不适用
  • 🔒 研发已否:S2 中判定不可实现的项(WiFi 自发现、权限统一获取)记录现状、不扣分

权重

  • ×3:异常排错、确定感、起步引导 ← S3 三大卡点 + S4 全列 P0
  • ×2:起点可达、路径可通、步骤、看得懂、接得上
  • ×1:等待、不重复、信任

v0 自带的诚实说明

权重只来自 Camera UK 一个季度 · S1「换网 84 单 12.7%」与 S3 阶段表对不上,以 S3 为准 · 耗时无埋点基线 · 竞品最佳实践只有 S2 零散几句 · 「走查记录」页为空

02 · 外部对照

拿 10 项外部一手来源检验 PM 框架

用户研究 / 学术

  • X1 NN/g 智能设备 onboarding 5 条指南(E3)
  • X2 Dartmouth HotMobile'24:12 台设备认知走查,含 Tapo(E3)
  • X3 IEEE CCNC'24:15 台设备 19 条问题(摘要,E2)
  • X10 NN/g 智能家居三类用户(E3)

标准 / 平台

  • X4 CSA Matter 1.4.1:ESF 同意流、多设备 QR、NFC(E3)
  • X5 Matter Handbook:commissioning 流程与 fail-safe(E2)
  • X6 Amazon:三种 commissioning flow(E3)
  • X7 Amazon Frustration-Free Setup:Zero/Light-Touch、Simple Reconnect(E3)
  • X8 Apple HIG HomeKit:系统流程优先(E3)
  • X9 ISO 9241-110:2020 七原则(二手转述,E2)

结论:PM 框架「合适但不完整」——四类与 ISO 原则对得上、权重有数据;但旅程范围窄,有 12 个缺口,且四类之间不正交

02 · 外部对照

12 个缺口 · 上半(按严重度)

G1

旅程范围太窄

只从 App 内「添加设备」开始。X2 把旅程分为准备 → App 与账号 → 配对 → 配置;S3「不会开始」12.7% 有一部分发生在进 App 之前

G2

重连没当成完整旅程

X1「Treat reconnection like first-time setup」;X7 Simple Reconnect 改密码后自动保持连接。v0 只有一条排错子项

G3

没有「可控性」维度

返回 / 取消 / 中途退出 / 失败回滚。X9 第 5 原则;X5 Matter fail-safe 协议级回滚。v0 只有「中断可续」

G4

设备端反馈不在评审对象里

X1 要求告诉用户设备会有什么反馈(闪灯 / 蜂鸣)。v0 只评「灯状态文案」,不评灯语本身与 App 是否同步

G5

进度「诚实性」缺失

X1 用户原话:假进度条走两分钟然后失败。v0 要求「有进度」,没要求「进度真实、超时快速失败」

G6

报错四要素少两个

X1:具体 / 可行动 / 流程内求助 / 从失败点重试。v0 只有前两条;S3 案例用户「自己 Google 解决」

02 · 外部对照

12 个缺口 · 下半

G7

账号 / 同意 / 隐私零覆盖

X4 Matter 1.4.1 把 T&C 同意放进流程;X2 账号注册是主要时间坑;Camera 是隐私敏感品类

G8

多生态路径缺失

X8 Apple:先走系统 setup 再做自家 post-setup;X6 三种 commissioning flow。Tapo 部分机型支持 Matter,框架默认单 App

G9

零输入只做了一半

X7 Zero-Touch 上电即完成、Light-Touch 一次确认;X2 建议凭据存账号。v0 只到「带入当前手机 WiFi」

G10

多用户家庭

X10:设置者 ≠ 日常使用者 ≠ 受限用户。绑定完没有「分享家人」入口

G11

无障碍 / 本地化

一条没有。S3 原文 LED「红绿闪烁」——红绿色盲直接不可辨,是现成反例;UK 工单显示地区路由器差异

G12

没有度量层

纯定性,agent 输出对不上漏斗;X7 Amazon 以退货率和评价做 FFS 结果指标;S1 埋点「进行中」

结构性症状:v0 里 C2「不用选」全是「= 其他项」,D2「安全感」并入 A3——说明 4 类不正交,单轴分类撑不住完整框架

03 · v1 框架

从「问题分类」
到「旅程阶段 × 质量原则」矩阵

PM 框架是修 bug 清单长出来的:对现有流程病灶抓得准,但评不出「本来就不该有这一步」。矩阵的好处:空格会自己暴露盲区。

03 · v1 框架 · 横轴

7 个旅程阶段(X2 四阶段扩展 + X1 重连 + S3 卡点阶段)

P0 准备开箱 · 说明书 · 物理安装 / 上电 · 找到 App
P1 App 与账号装 App · 注册 / 登录 · 地区 · T&C · 权限
P2 发现与识别入口 · 扫码 / 自发现 / 选型 · 进配对模式(灯态)
P3 连接与入网 ★SoftAP / BLE · 选 WiFi · 输密码 · 连路由器 · 上云配对
P4 配置与首用命名 / 房间 / 图标 · 非阻塞设置 · 首次价值
P5 重连与换网离线检测 · 提醒 · 重连向导 · 换路由器
P6 扩展第二台零输入 · 批量 · 分享家人 · Matter

P3 是权重中心

S3 工单 ②③④⑤ 四个阶段全落在 P3,合计 32%,加上 ①「不会开始」共 45% 的可归因卡点;P3 列 ×3,P2 / P5 ×2

P0 / P1 / P5 / P6 是新增段

对应缺口 G1 / G2 / G7 / G8 / G9 / G10。P0 只在有实物或说明书样本时评;P6 Matter 分支只对支持机型评

阶段边界要写死

每段有明确「进入事件」和「退出事件」(如 P3 从「点选 WiFi」到「App 显示设备在线」),agent 才能把截图归到唯一阶段

03 · v1 框架 · 纵轴

8 条质量原则(ISO 9241-110 七原则 + NN/g 的「诚实」)

Q1 可达

前置条件够、路径存在
v0 走得通 A1/A2 · X9 #1

Q2 高效

步骤少、等待短、不重复输入
v0 走得快 B · X2 · X7

Q3 看得懂

每步不看说明也知道要干什么、系统在干什么
v0 C1 · X9 #2 · X1

Q4 一致

跨机型、跨平台、App 与设备灯语一致
新增 · X9 #3 · X8 · X1

Q5 可控

可返回、跳过、取消、安全退出、失败回滚
新增 · X9 #5 · X5

Q6 可恢复

报错具体、可行动、流程内求助、从失败点重试
v0 A3 · X1 · X9 #6

Q7 诚实

进度真实、时间可估、状态不撒谎、不假完成
v0 D1 强化 · X1

Q8 信任

隐私同意清楚、品牌一致、完成后有首次价值
v0 D3 · X9 #7 · X4 · X8

teal 顶边 = v0 完全没有的原则。Q6 / Q7 两行 ×2,对应 S3 最大卡点与 S4 P0「错误码体系」「进度与状态感知」

03 · v1 框架 · 矩阵

7 × 8 = 56 格,每格问「这个阶段,这条原则满足了吗」

P0 准备P1 账号P2 发现P3 入网 ×3P4 首用P5 重连 ×2P6 扩展
Q1 可达P0.1 扫码直达P1.3 权限前置A1.1 A1.2 A2.1A2.2 A2.3 A2.4P5.1 离线提醒P6.3 Matter 路径
Q2 高效P1.1 注册 ≤2 屏B1.1 B1.3B3.1 A3.5 B2.1B1.4 B1.5 B1.6 B3.2P5.3 批量更新P6.1 零输入
Q3 看得懂P0.2 SN 可查C1.1 P2.2 灯语C1.2 C1.4C1.3P5.2 = 首配详尽
Q4 一致P0.1 与 App 一致B1.2 P2.1通用.2 双平台D3.1 图标P6.3 系统流程优先
Q5 可控P1.1 不阻断A2.1 重选P3.3 回滚 C3.1P4.2 可跳过
Q6 可恢复 ×2A3.6 重试A3.1–A3.4 P3.2A3.4 换网
Q7 诚实 ×2D1.1 步骤器D1.2 D1.4 P3.1D1.3 不假完成
Q8 信任P0.3 安装可回看P1.2 同意 A1.6P4.1 首次价值P6.2 分享家人

A/B/C/D 编号 = v0 已有 35 条;P/通用 编号 = 新增 21 条;「—」= 当前无检查点的格子,是下一轮要确认「真不需要」还是「还没想到」的地方。深浅色 = 列权重

04 · 怎么定标准

制定「完整且全员」的维度:5 步,每步有产出物

1

先定旅程边界,不先定维度

写出每个阶段的进入 / 退出事件与品类分支(Camera / IoT / 蓝牙 / Matter)。产出:阶段定义表。依据 X2 四阶段 + S3 卡点阶段

2

用外部原则做纵轴,用内部数据做权重

原则来自 ISO / NN/g(不随产品变),权重来自工单 / 埋点(随产品变)。两者分开,框架才能跨产品线复用。产出:原则表 + 权重表

3

每个格子写检查点,每条检查点必须有引用

「S2 #15」或「X1 报错四要素」级别的定位,不接受「业界惯例」。没有引用的检查点先进候选池。产出:检查点清单(当前 56 条)

4

每条检查点写四级成功标准

不通过 / 通过 / 好 / 优秀 各一句可观察的描述(下页)。「优秀」必须能指向一个外部标杆;「通过」= 满足内部已定需求。产出:评分 rubric

5

拿真实机型试评两轮再定稿

≥2 名评估者独立打分 → 合并 → 分歧项改写 rubric(NN/g:单人只能发现约 1/3 的问题)。产出:校准记录 + v1.1

04 · 怎么定标准 · 成功分级

四级成功标准:每一级对应可观察的事实,不是形容词

0

不通过 Fail

阻断任务或违反原则;用户需要外部帮助才能继续。对应 Nielsen 严重度 3–4(major / catastrophe)

S3 工单里有对应卡点 = 直接判 0

1

通过 Pass

满足内部已定需求(S1 需求池 / S2 研发认可项),无 major 问题;可能有 cosmetic / minor(严重度 1–2)

= 「做了该做的」

2

好 Good

达到外部指南(NN/g / 平台 HIG / Matter 规范)的明确要求;用户不看说明书也能一次过

必须能指向 X1–X10 某条

3

优秀 Excellent

超过行业指南:把步骤消除而非优化(零输入、系统替用户判断、失败前预防)

对标 Amazon ZTS / Apple 系统流程级

为什么四级而不是 1–5

四级没有「中间值」,逼评估者表态;0 与 1 的界线借 Nielsen 0–4 严重度(频率 × 影响 × 持续性)已有 30 年共识;2 与 3 的界线用「内部需求 vs 外部标杆 vs 消除步骤」三层锚点,可解释

两个附加状态

➖ 不适用:该机型无此环节,不计分母 · 🔒 研发已否:S2 判定不可实现,记录现状不计分,但进「待技术解锁」清单——避免 audit 反复骂设计

04 · 怎么定标准 · 分级示例

三条检查点的四级写法

检查点0 不通过1 通过2 好3 优秀
P3.1 进度诚实
Q7 × P3 · X1 · S2 #8/#11
无限转圈或进度条与真实状态无关;超时后才报失败有阶段文字(连接中 / 注册云端)+ 超时上限 ≤ 设定值即失败显示预估时长;接近超时前倒计时;进度只在有真实进展时前进失败前预判并提前告知(信号弱 / 频段不符),把「等到失败」变成「提前改正」
A3.1 报错分支
Q6 × P3 · X1 · S2 #9 · S4 P0
通用「连接失败,请重试」;无错误码有错误码 + 对应排错页;区分连不上路由器 / 配对失败报错四要素齐:具体 / 可行动 / 流程内求助入口 / 从失败点重试App 自动诊断并一键修复(切频段 / 改 DNS / 连回原 WiFi),用户只按确认
B3.1 WiFi 凭据
Q2 × P3 · X2 · X7 · S3 2b
每台设备手输 SSID + 密码;旧凭据静默沿用导致换网失败默认带入手机当前所连 WiFi;密码有 64 位上限与空格提示账号内已配设备的凭据可选复用;换网后明确提示「凭据已过期」第二台设备零输入(Amazon LTS 级);改密码后批量更新全部设备(Simple Reconnect 级)

写法规则:每格只写「能截图证明」的事实;「0」引用工单或测试问题编号;「2」引用外部指南条目;「3」引用行业上限实例。写不出「3」的检查点 → 说明它是合规项而非体验项,权重降为 ×1

04 · 怎么定标准 · 打分与汇总

从检查点到维度到总分:三层汇总 + 一条封顶规则

检查点层

  • 得分 0–3(四级)
  • 每条附截图 + 阶段 + 原则 + 引用
  • 0 分项另记严重度(Nielsen 0–4:频率 × 影响 × 持续性)与可选的工单占比

维度层(行 / 列)

  • 阶段分 = Σ(检查点得分 × 权重) / Σ(权重 × 3),换算成 0–100%
  • 原则分同法按行汇总
  • 封顶规则:任一检查点严重度 4(catastrophe)→ 该阶段最高只能「通过」

总分层

  • 总分 = 阶段分按列权重(P3 ×3、P2/P5 ×2)加权
  • 报告不只给总分,给 7 × 8 热力图——空格和红格比总分有用
  • 同一机型每季度复评,看格子颜色变化而非分数涨跌

评估者纪律(NN/g 启发式评估流程)

≥2 人独立评 → 不讨论 → 合并去重 → 分歧 ≥1 级的格子回看截图重议 → 严重度在合并后单独问卷打分(Nielsen 建议评估时不打严重度,事后集中打)

Agent 的角色边界

Agent 负责:按矩阵归类截图、比对 rubric 给初评、附引用、找空格。人负责:0 / 1 边界的最终判断、严重度、「研发已否」是否解锁。Agent 初评 ≠ 结论

04 · 怎么定标准 · 度量层与报告

定性矩阵旁边挂一层漏斗指标,报告用固定结构

每个阶段配的指标(补 G12)

  • 进入率 / 完成率:阶段漏斗
  • 中位耗时:等 S1 埋点回来定 B2 阈值
  • 失败后重试率 / 放弃率:Q6 的结果指标
  • 求助点击率:流程内 FAQ / 客服入口
  • 工单率 / 退货率:X7 Amazon 用来证明 FFS 价值的两个数

矩阵说「哪里应该有问题」,指标说「哪里实际有问题、多严重」,两者交叉才算发现

Audit 报告固定七段

  • ① 范围:机型 / 平台 / 版本 / 评估者 / 日期
  • ② 7 × 8 热力图 + 总分
  • ③ 0 分项清单(按严重度 × 列权重排序)
  • ④ 每项:截图 · 阶段 · 原则 · 引用 · 当前 vs 通过 vs 好 的差距
  • ⑤ 🔒 研发已否清单(待技术解锁)
  • ⑥ 空格清单(矩阵里没检查点的格子)
  • ⑦ 与上季度 / 竞品同机型的格子对比
05 · 下一步与局限

定稿前还差什么

下一步

  • 把 56 条检查点逐条写四级 rubric(本 deck 示范 3 条)
  • 读 D460 专项页,拿一个真实机型走一遍矩阵试评,校准粒度
  • 竞品同矩阵走查(Ring / Eufy / Arlo / Google Home / Aqara),给「3 优秀」找实例
  • 埋点数据回来后定 B2 耗时阈值
  • 每条检查点配「合格样例截图」,供 agent 视觉比对

局限(写进报告的免责)

  • 权重只来自 Camera UK 一个季度工单
  • ISO 9241-110 为二手转述;IEEE 论文 19 条原文在付费墙后
  • Google Home setup UX 指南正页未拿到
  • S1 换网 84 单与 S3 阶段表口径不一致,以 S3 为准
  • 「走查记录」页为空,无内部样本可校准
附录 · 信源

所有引用可回溯

内部(E4)

  • S1 OB优化框架 · pdconfluence pageId 394930072 · v14 · 2026-07-21
  • S2 OB安装问题专项 · pageId 342007491 · v30 · 2026-07-01
  • S3 OB优化-技术支持反馈 · pageId 400829787 · v1 · 2026-07-07
  • S4 OB优化-汇报思路 · pageId 403719059 · v1

外部

  • X1 nngroup.com/articles/smart-device-onboarding(E3)
  • X2 Wang et al., HotMobile'24, par.nsf.gov/servlets/purl/10528542(E3)
  • X3 Chanda et al., IEEE CCNC'24, doi 10.1109/CCNC51664.2024.10454634(E2)
  • X4 csa-iot.org · Matter 1.4.1 setup(E3)· X5 handbook.buildwithmatter.com commissioning(E2)
  • X6 developer.amazon.com · best-practices-commission-matter(E3)· X7 · frustration-free-setup/understanding-ffs(E3)
  • X8 developer.apple.com · HIG HomeKit(E3)· X9 ISO 9241-110:2020 via dialogdesign.dk(E2)· X10 nngroup.com/articles/smart-home-users(E3)
  • 严重度 nngroup.com/articles/how-to-rate-the-severity-of-usability-problems(E3)

证据等级 E0–E4:E4 内部一手文档 · E3 官方 / 权威一手 · E2 二手转述或仅摘要 · 全文与检查点清单见 projects/ux-audit-agent/