Tests & Tools

Automatisiertes vs. manuelles Testen der Barrierefreiheit

Kein automatisierter Barrierefreiheitsscanner – auch nicht der von AllyProof – kann WCAG allein zu 100 % bewerten, und jedes Tool, das das Gegenteil behauptet, sollte skeptisch betrachtet werden.

Vor der Aufschlüsselung eine Unterscheidung, die für die meiste Verwirrung in diesem Feld sorgt. Es werden zwei verschiedene Dinge gezählt:

  • Problemvolumen – welchen Anteil der tatsächlichen Barrierefreiheitsprobleme einer echten Website ein Scanner findet. Deques Automated Accessibility Coverage Report hat das über rund 2.000 Audits gemessen: automatisiertes Testen erkannte 57,38 % der erfassten Probleme. Daher stammt die viel zitierte Zahl „57 %".
  • Kriterien – zu welchem Anteil der WCAG-Erfolgskriterien ein Scanner überhaupt etwas sagen kann. Derselbe Bericht fand automatisiert erkennbare Probleme nur bei 16 von 50 WCAG-2.1-A/AA-Erfolgskriterien.

Beim Volumen schneiden automatisierte Regeln deutlich besser ab als bei den Kriterien, weil die Fehler, auf die sie prüfen, zugleich die häufigsten sind. Keine der beiden Zahlen bedeutet, dass ein Scan ohne Befund Konformität belegt: Automatisierte Regeln erkennen Fehlerbedingungen, sie bestätigen nie die Erfüllung eines Kriteriums.

Auf Kriterienebene ergibt sich eine Dreiteilung. Die Zahlen unten sind AllyProofs eigene Einordnung der 55 aktiven WCAG-2.2-Erfolgskriterien der Stufen A und AA.

Automatisierte Fehlererkennung verfügbar (12 von 55, ~22 %)

Hier liegen beobachtbare Regelbedingungen vor, etwa ein fehlendes Attribut oder eine Textkontrastberechnung. Prüfen Sie beim Bewerten eines Befunds Nachweise und Kontext. Eine Regel, die keinen Fehler meldet, belegt nicht die Erfüllung des gesamten Kriteriums. Siehe axe-core erklärt.

Beispiele: Unzureichender Farbkontrast (1.4.3), Fehlende Seitensprache (3.1.1), Fehlender Seitentitel (2.4.2), Ungültige ARIA-Attribute (4.1.2).

Teilweise automatisiert prüfbar (13 von 55, ~24 %)

Ein Scanner kann ein Muster erkennen, das oft (aber nicht immer) ein echtes Problem ist und menschliche Bestätigung benötigt. Ob ein alt-Attribut vorhanden ist, lässt sich mechanisch prüfen; ob der Alternativtext eine gute Beschreibung ist, erfordert, dass eine Person ihn liest und beurteilt – deshalb steht Nicht-Text-Inhalt (1.1.1) hier und nicht in der Kategorie darüber. Ob eine Überschriftenstruktur existiert, ist prüfbar; ob Überschriften aussagekräftig sind (gemäß Überschriften und Beschriftungen), erfordert menschliches Urteilsvermögen.

Manuelle Bewertung erforderlich (30 von 55, ~55 %)

Mehr als die Hälfte der aktiven A/AA-Kriterien erfordert tatsächlich einen Menschen – kein aktueller automatisierter Ansatz kann diese überhaupt einschätzen:

  • Ob eine Audiodeskription den visuellen Inhalt eines Videos genau vermittelt
  • Ob die Lesereihenfolge einer Seite tatsächlich logisch ist (im Gegensatz zu nur strukturell konsistent)
  • Ob die Tastaturfokus-Reihenfolge dem beabsichtigten logischen Ablauf einer Seite entspricht
  • Ob Fehlermeldungen tatsächlich hilfreich sind, nicht nur technisch vorhanden

Warum Offenlegung wichtiger ist als der Automatisierungsprozentsatz selbst

Der genaue Prozentsatz ist weit weniger wichtig als Transparenz darüber, welche Kriterien bei einem gegebenen Scan in welche Kategorie fallen – und was ein Ergebnis ohne Befund in jeder Kategorie tatsächlich belegt. Ein Bericht, der klar zwischen "bestätigten Verstößen", "manueller Prüfung erforderlich" und "keine automatisierte Regel – manuelles Audit nötig" trennt, ist vertrauenswürdiger und nützlicher als einer, der Abdeckung überhöht darstellt oder alles in einen einzigen "Score" ohne offengelegte Methodik bündelt. Genau darum ging es auch in der FTC-Verfügung vom April 2025 gegen accessiBe: um Aussagen, die die Nachweise nicht trugen – nicht um den Einsatz von Automatisierung.

Was das praktisch bedeutet

Behandeln Sie einen automatisierten Scan als einen starken ersten Durchgang, der viele der häufig zitierten Fehlermuster mit hohem Prozessrisiko zuverlässig erkennt (siehe Trends bei Web-Barrierefreiheitsklagen) – aber nicht als Ersatz für eine vollständige manuelle Prüfung, wenn echte, umfassende WCAG-Konformität das Ziel ist, insbesondere bei allem, was kundenseitig sichtbar ist und echte rechtliche oder Reputationsrisiken birgt.

Häufige Fragen

Welchen Anteil der WCAG können automatisierte Werkzeuge prüfen?
Es kursieren zwei Zahlen, die Unterschiedliches messen. Nach Kriterien - automatisierte Regeln erkennen die häufigen Fehlerbedingungen für rund 22 % der 55 aktiven WCAG-2.2-A/AA-Erfolgskriterien, decken weitere 24 % teilweise ab und erreichen die verbleibenden 55 % nicht. Nach Problemvolumen - Deque maß, dass automatisiertes Testen 57,38 % der in seinem Audit-Datensatz erfassten Probleme erkannte. Keine der beiden Zahlen bedeutet, dass ein Scan ohne Befund Konformität belegt.
Kann ein automatisierter Scanner eine Website WCAG-konform machen?
Nein. Kein automatisiertes Werkzeug kann die gesamte WCAG bewerten, und Anbieter, die etwas anderes versprechen, sollten kritisch betrachtet werden. Mehr als die Hälfte der Erfolgskriterien hat überhaupt keine automatisierte Regel, und selbst wo Regeln existieren, erkennen sie Fehler, statt Erfüllung zu bestätigen.
Wofür eignet sich automatisiertes Testen?
Als zuverlässiger erster Durchgang, der die häufigsten und rechtlich riskantesten Probleme findet – fehlende Alternativtexte, zu geringer Kontrast, fehlende Beschriftungen – bevor ein manuelles Audit den Rest abdeckt.

Möchten Sie sehen, wie Ihre eigene Website abschneidet?

Kostenlosen Barrierefreiheitsscan durchführen