几乎没人再在乎Web标准了:近90%头部网站存在HTML规范违规
作者: CBISMB
责任编辑: 邹大斌
来源: CBISMB
时间: 2026-08-18 11:14
浏览: 0
点赞: 0
收藏: 0
网页开发者是否正在失去对标准的尊重?一项针对全球最大网站的最新审查给出了肯定答案。
ValidateHTML是独立法国开发者Théo Ducreux发起的项目,它检查了由Tranco研究项目估算的全球访问量最高的5000个网络域名,其中包括Google、YouTube、Akamai等知名站点,也包括一些没有面向公众组件的域名(如Google的gstatic、EZVIZ的Ezviz7)。
Ducreux发现,超过一半(2656个)站点提供了人类可读的首页,其余许多站点(如Google和EZVIZ)只是流量重定向站点,充当公司产品回传信号的信标。
无论是否为无头页面,近90%的站点都没有按照万维网联盟(W3C)和WHATWG(Web超文本应用技术工作组)的规范提供合规的HTML。这些标准之所以重要,是因为它们确保不同的浏览器和阅读工具能够以基本一致的方式渲染所请求的页面。
违规数据触目惊心
Ducreux在所有站点中共统计出100305处HTML违规(包括最新的HTML5规范),外加18863处CSS错误。换言之,87.2%的网站至少在一处违反了Web规范,仅12.8%拥有完全有效的HTML。而完全"干净"——零错误、零最佳实践警告——的网站仅占2.6%。
更令人警醒的是,超过三分之一的网站未通过无障碍访问检查。考虑到2025年《欧洲无障碍法案》的潜在适用范围,对网站所有者而言,这更像是一个法律合规问题而非面子问题。(在美国,不注重无障碍体验的电商网站若惹怒了全国盲人联合会,后果同样不堪设想。)
在无障碍方面,20.4%的网站图片缺少alt文本,而这些图片往往包含关键信息。更糟糕的是,41.6%的页面缺少用于标识页面区域的ARIA标签,可能导致屏幕阅读器难以传达页面结构——相当于丢给辅助技术一个iframe,让它自己看着办。
"屏幕阅读器的容错能力远不及Chrome,"Ducreux表示,"所以那些在你看来完全正常的标记,对使用辅助技术的人来说可能是坏的。"
标准缺失的深层原因
Ducreux为该项目使用了自己编写的网络爬虫和一组开源解析器(HTML-validate、CSS Validator、Lightning CSS、fast-xml-parser)。他在邮件中解释道:"网站、评分系统和爬虫逻辑都是我自己的代码。没有团队,没有资金,没有公司。"
缺乏标准遵守是否真的重要?这是一个开放性问题。Web之父Tim Berners-Lee在1999年写道:"Web与其说是一项技术创造,不如说是一项社会创造。"如果每个人都各搞一套标准,连接和沟通就会变得更加困难。
当前流行的"死亡互联网理论"——认为AI机器而非人类构成了大部分互联网流量——并不能让开发者们脱钩。正如Shopify的工程师所发现的,即使是超级智能也偏好规范的标记。
浏览器也难辞其咎。除非你对短命但严格无比的XHTML情有独钟,否则今天的浏览器只会忽略它们无法理解的代码。"浏览器在错误恢复方面如此出色,以至于没有任何东西迫使任何人修复他们的代码,"Ducreux写道,"这正是问题积累的原因。"纵容催生懈怠。
前端框架也制造了自己的麻烦。最常见的故障(出现在超过59%的站点中)是元素位置错误,即标签嵌套不当。你知道不允许在div盒子内放置style元素吗?许多框架显然这么做了。"这是构建时产生的嵌套问题,不是在编辑器中产生的,"Ducreux写道,"没有人手写那种代码。"
对非浏览器客户端的影响
许多人认为糟糕的HTML无伤大雅。Ducreux自己也不认为无效HTML对Web构成生存威胁——除了阻碍无障碍访问之外。但与此同时,Web不仅仅是关于浏览器的。
"说实话,大多数无效HTML不会破坏任何可见的东西,浏览器擅长猜测你的意图并默默修补,"他在邮件中写道。但他同时指出:"AI代理读取页面、语音助手、翻译工具、屏幕阅读器——它们都没有Chrome那20年猜测你意图的经验。按照规范编写,才能让一个页面对所有这些工具表达相同的含义,而不仅仅是对当天在Chrome中渲染它的那个人。"