PAGEADVICE / 方法

一份报告是怎么来的

审查究竟在看什么

审查会像访客一样打开你提交的页面并抓取它,然后只依据当时真实出现在屏幕上的内容做判断:文字、标题、控件、图片、配色,以及那一次加载的实测耗时。它不会在你的站点上运行自己的脚本,不会登录,也不会点击任何东西。凡是需要这些操作才能得出的结论,都不在一份报告能够如实给出的范围内。

依据哪些标准

可用性方面参照 Nielsen 十大可用性启发式。可访问性方面参照 WCAG 2.2 A/AA 中「一张静态抓取能够真正提供证据」的那部分条款——对比度、替代文本、结构、标签、目标尺寸等。关于键盘操作、焦点顺序和时序的条款被有意排除在外:这里没有任何环节会去操作页面,一条无法被证明的引用,价值还不如不引用。

为什么有的建议引用条款,有的不引用

只有当一条建议自身的证据确实构成该条款的实例时,它才会引用这个条款。大多数建议不引用任何条款,这是预期的结果。错误的条款号会为一条建议借来它并不具备的权威,而一处可被核实的错误,会让报告里其余所有引用一起失去可信度。

为什么报告很短

Baymard Institute 一项被 Jakob Nielsen 引用的研究,让通用模型审查电商页面截图,结果是:19% 的建议可靠,72% 照做纯属浪费时间,9% 有实际害处,平均每张截图凭空生成十一条不存在的问题。长度很容易做出来,代价却由读者承担:每一条假问题都要花时间去核实,也会消耗你对其余建议的信任。这里的报告通常是 3 到 8 条。这是关于信噪比的选择,不是能力的上限。

截图上的标注为什么不会标错位置

抓取时会记录下每个元素的位置,而一条建议要指向页面,只能引用这些已记录元素中的一个。坐标是事后由抓取结果还原的,因此位置无法被估算,也无法被编造。当没有任何已记录元素能够匹配时,这条建议就不带标注显示,而不是大致标一个位置——把标记打在你页面的错误位置,比不打标记更糟。

分数是怎么定的

综合分由发现本身约束,不能随意给出。只要存在一条 P0,分数上限就是 69;存在 P1 则上限 84;全部为 P2 的页面起步就在 75;并且综合分不会高于最弱维度 15 分以上。所以低分背后一定有具体的发现,而高分也不可能与严重问题共存。

这里不做什么

不生成注意力热力图或预测眼动图。那类图需要真实人群的注视数据;让模型去「猜」注意力落点,可以画出一张很有说服力却毫无依据的图,与其如此,不如什么都不给你。审查同样不能替代真人可用性测试,也不构成无障碍、法律或安全方面的认证。它是一次快速、有据可依的初审,最终判断权在你。