3min Devops

Bijna negen op tien websites bevatten foute HTML

Bijna negen op tien websites bevatten foute HTML

Bijna negen op de tien populaire websites bevatten HTML die niet volledig aan de officiële webstandaarden voldoet. Voor browsers levert dat meestal weinig problemen op, maar screenreaders en andere software kunnen de fouten minder gemakkelijk opvangen. Ook AI-agents die websites uitlezen kunnen daardoor tegen problemen aanlopen.

Dat blijkt uit onderzoek van ValidateHTML, een project van de Franse ontwikkelaar Théo Ducreux. Hij onderzocht de 5.000 populairste domeinen uit de Tranco-ranking. Van 2.656 daarvan kon een voor mensen leesbare homepage worden geanalyseerd. Daarop werden in totaal 100.305 overtredingen van de HTML-specificatie gevonden.

Van de onderzochte sites bevat 87,2 procent minstens één HTML-fout. Slechts 12,8 procent heeft volledig geldige HTML. Wanneer ook waarschuwingen voor best practices worden meegerekend, blijft slechts 2,6 procent volledig foutloos. Daarnaast werden 18.863 CSS-fouten aangetroffen.

Browsers corrigeren fouten

Dat zoveel fouten nauwelijks worden opgemerkt, komt mede doordat moderne browsers tolerant omgaan met ongeldige HTML. Chrome en andere browsers proberen te bepalen wat een ontwikkelaar heeft bedoeld en corrigeren problemen tijdens het opbouwen van een pagina. Daardoor kan een website er normaal uitzien terwijl de onderliggende HTML niet aan de specificaties voldoet.

Volgens Ducreux zorgt die tolerantie er tegelijkertijd voor dat fouten zich kunnen opstapelen. Als een fout geen zichtbaar probleem veroorzaakt, bestaat er voor ontwikkelaars weinig aanleiding om hem te herstellen.

De meest voorkomende fout betreft verkeerd geplaatste of geneste HTML-elementen. Dit probleem kwam voor bij ruim 59 procent van de onderzochte sites. Volgens Ducreux ontstaan dergelijke fouten vaak tijdens het buildproces van front-endframeworks. Het gaat dus niet noodzakelijk om code die een ontwikkelaar zelf verkeerd heeft geschreven.

Problemen met toegankelijkheid

De gevolgen worden duidelijker wanneer websites door andere software dan browsers worden verwerkt. Meer dan een derde van de onderzochte sites faalde bij controles op toegankelijkheid, schrijft The Register. Zo ontbreekt bij 20,4 procent van de websites alternatieve tekst bij afbeeldingen en mist 41,6 procent ARIA-labels waarmee onderdelen van een pagina voor hulpmiddelen herkenbaar worden gemaakt.

Dat kan problemen opleveren voor screenreaders, software die websites voor blinde en slechtziende gebruikers voorleest. Volgens Ducreux kunnen dergelijke programma’s veel minder goed met foutieve HTML omgaan dan Chrome. Een pagina die er voor een ziende gebruiker correct uitziet, kan daardoor voor iemand die een screenreader gebruikt onduidelijk of moeilijk navigeerbaar zijn.

Daarmee krijgt slechte HTML ook een compliance-aspect. Sinds 2025 geldt in de Europese Unie de European Accessibility Act, die toegankelijkheidseisen stelt aan verschillende digitale producten en diensten.

Ook AI-agents lezen websites

Correcte HTML kan daarnaast belangrijker worden door de opkomst van AI-agents. Websites worden steeds vaker niet alleen door browsers verwerkt, maar ook door AI-systemen, voice assistants en vertaalsoftware. Die systemen beschikken niet noodzakelijk over dezelfde uitgebreide foutcorrectie die browsers in de loop van tientallen jaren hebben ontwikkeld.

Volgens Ducreux is dat een reden om webstandaarden niet als achterhaald te beschouwen. Ongeldige HTML vormt meestal geen direct probleem voor bezoekers die een moderne browser gebruiken, maar correcte markup zorgt ervoor dat de betekenis en structuur van een pagina ook voor andere software behouden blijven.

ValidateHTML is een onafhankelijk project van Ducreux. Voor het onderzoek gebruikte hij een zelfontwikkelde crawler in combinatie met verschillende open-source parsers voor HTML en CSS. Van de oorspronkelijke 5.000 domeinen konden 2.344 niet worden meegenomen, onder meer omdat ze geen normale homepage aanbieden of geautomatiseerde verzoeken blokkeren.