Methodik des Anglizismen-Checks

Vollständige Offenlegung, wie wir die Klarheitsbewertung berechnen: Formel, Gewichte, Wörterbuchquellen und Tokenisierungsentscheidungen. Keine Black Boxes — jede Zahl ist transparent und reproduzierbar.

📐 Bewertungsformel

Die Endbewertung ist eine Zahl von 0 bis 100. Sie ergibt sich aus der geglätteten Dichte gewichteter Treffer: Das Gewicht jedes Treffers hängt von Schweregrad, Notwendigkeitsstufe, Domäne und Kontext (bei mehrdeutigen Wörtern) ab.

Gewicht = SCHWERE[Stufe] × NOTWENDIGKEIT[Tier] × Domänenfaktor × Kontext × Strenge gewichtet = Σ Gewicht Kontext: genau=1.0, möglich=0.3, deutsche_Bedeutung=0 Dichte = gewichtet / ( Wortzahl + 60 ) ← Glättung für kurze Texte Abzug = 100 × Dichte / ( Dichte + 0.04 ) Bewertung = max( 0 , round( 100 − Abzug ) )

Jeder Treffer zählt einmal; mehrwortige Wendungen gelten als ein Treffer. Mehrdeutige Wörter werden nach Kontext bewertet: in deutscher Bedeutung nicht abgewertet, bei Mehrdeutigkeit nur mild. Glättung und eine sanfte Kurve machen die Bewertung unabhängig von der Textlänge und zwischen Texten vergleichbar.

⚖️ Gewichte und Faktoren

Das Gewicht eines Treffers setzt sich aus Schweregrad, Notwendigkeitsstufe (VDS-Modell), Domäne und Strenge zusammen. Alle Werte sind im Code festgelegt und für alle Sprachen gleich.

Schweregrad

StufeGewichtBedeutung
low0.5Eingebürgerte oder neutrale Entlehnung („Manager").
medium1.0In manchen Kontexten OK, in anderen redundant („Content").
high2.0Vollständig durch ein deutsches Wort ersetzbar ohne Verlust („Deadline").

Strenge-Modus

ModusFaktorBedeutung
lax×0.6Mild (×0.6). Ignoriert in der Domäne zulässige Entlehnungen.
balanced×1.0Ausgewogen (×1.0, Standard). Zählt alles, aber milde.
strict×1.6Streng (×1.6). Geht härter ins Gericht.
purist×2.4Puristisch (×2.4). Keine Nachsicht, auch nicht bei Eingebürgertem.

Notwendigkeitsstufe (Tier) – Modell des VDS-Anglizismenindex

ModifikatorFaktorWann angewendet
Notwendig (×0.15)×0.15Keine genaue deutsche Entsprechung – Fachbegriff. Kaum abgewertet.
Nuancierend (×0.5)×0.5Gibt einen Beiklang oder ist eingebürgert. Halb abgewertet.
Verdrängend (×1.0)×1.0Vollwertige deutsche Entsprechung vorhanden. Volles Gewicht.

Modifikatoren

ModifikatorFaktorWann angewendet
Domäne passt (×0.4)×0.4Das Wort ist in der gewählten Domäne zulässig (z. B. ein IT-Begriff in einem IT-Text).
Kontext bei Mehrdeutigkeit×1.0 / ×0.3 / 0Bei mehrdeutigen Wörtern: genaue Bedeutung ×1.0, mehrdeutig ×0.3, deutsche Bedeutung – zählt nicht.

🎯 Noten

Die Punktzahl wird zur schnellen Orientierung auf einen Buchstaben abgebildet. Grenzen sind im Code festgeschrieben:

A
90–100
Ausgezeichnet
B
75–89
Gut
C
60–74
Gemischt
D
40–59
Schwach
F
0–39
Stark entlehnt

🧠 Tokenisierung & Rauschfilter

Vor dem Abgleich maskieren wir Fragmente, die wie Wörter aussehen, aber keine sind. Die Maskierung erhält Quell-Offsets, damit Markierungen genau bleiben.

  • URLs (https://…) — vollständig maskiert, sodass „site" in „https://site.com" nicht markiert wird.
  • E-Mail-Adressen — ebenso.
  • @Erwähnungen und #Hashtags — als Social-Markup übersprungen.
  • Inline-`Code` in Backticks — ignoriert.
  • camelCase- und snake_case-Identifier — als Code ignoriert.
  • Mehrwortphrasen (z. B. „user experience") werden vor Einzelwörtern erkannt und verbrauchen ihre Token, damit sie nicht doppelt zählen.
  • Bekannte Marken und Eigennamen (Apple, Yandex, ChatGPT) werden übersprungen. Die Liste wird pro Sprache über `meta.brands` erweitert.

📚 Wörterbücher pro Sprache

Alle Wörterbücher sind frei als JSON verfügbar. Nutzen Sie sie in Ihren Projekten, zitieren Sie in der Forschung, senden Sie Korrekturen.

Häufig zitierte Einträge haben eine eigene Quelle (`src`) — sichtbar im Popover je Wort. Mit fortschreitender Kuration ergänzen wir Einträge mit eigener Quellenangabe.

Russisch 2805 · v2026-07-23-r5 · CC0

Quellen
  • RAN reference dictionaries
  • Gramota.ru
  • VDS Anglizismenindex (cross-ref)
  • НКРЯ (Национальный корпус русского языка)
  • Словарь молодёжного сленга 2020-25

Deutsch 1187 · v2026-07-16-de2 · CC0

Quellen
  • VDS Anglizismenindex (cross-ref)
  • Duden Fremdwörterbuch (descriptive)
  • VDS Anglizismenindex
  • Duden
  • Wahrig Fremdwörterlexikon
  • Goethe-Institut Wortschatz

Französisch 2460 · v2026-07-16-fr1 · CC0

Quellen
  • Académie française — Dire, ne pas dire
  • OQLF Vitrine linguistique
  • TERMIUM Plus
  • Larousse
  • FranceTerme (CULTURE.FR)
  • Office québécois de la langue française (OQLF)
  • Le Robert

Spanisch 968 · v2026-07-16-es1 · CC0

Quellen
  • RAE Diccionario panhispánico de dudas
  • Fundéu RAE
  • Diccionario de la lengua española (DRAE)
  • RAE — Diccionario de la lengua española
  • RAE — Diccionario panhispánico de dudas
  • Fundéu BBVA
  • CORPES XXI
  • Banco de neologismos del CSIC

Portugiesisch 1030 · v2026-07-16-pt1 · CC0

Quellen
  • Academia Brasileira de Letras (ABL)
  • Ciberdúvidas da Língua Portuguesa
  • Vocabulário Ortográfico da Língua Portuguesa (VOLP)
  • Priberam
  • Houaiss
  • Aulete
  • Acordo Ortográfico de 1990

Koreanisch 767 · v2026-07-16-ko1 · CC0

Quellen
  • 국립국어원 외래어 표기 용례
  • 국립국어원 우리말 다듬기
  • 표준국어대사전
  • 국립국어원 (NIKL)
  • 우리말샘
  • 외래어 표기법
  • 한국어 어문 규범

Indonesisch 745 · v2026-07-16-id1 · CC0

Quellen
  • KBBI (Kamus Besar Bahasa Indonesia)
  • Badan Bahasa — Pedoman Padanan Istilah Asing
  • Pusat Bahasa
  • Badan Pengembangan dan Pembinaan Bahasa
  • Tata Bahasa Baku Bahasa Indonesia

Arabisch 663 · v2026-07-16-ar1 · CC0

Quellen
  • مجمع اللغة العربية بالقاهرة
  • مجمع اللغة العربية الأردني
  • معجم الوسيط
  • المعجم العربي الأساسي
  • مجمع اللغة العربية في دمشق
  • معجم اللغة العربية المعاصرة

🤝 Ehrlich über Grenzen

Wir wollen Referenz sein — deshalb sagen wir offen, was das Tool kann und was noch nicht.

Was wir noch nicht tun: Lemmatisierung ist näherungsweise (Regex über Wortstamm und Endungen). Eigennamen werden nicht vollständig getrennt. Kontextuelle Grammatik wird nicht berücksichtigt. Diese Verbesserungen stehen auf der Roadmap; bis dahin ist Ausgewogen mit aktivierten Eingebürgerten der zuverlässigste Modus.

📜 Lizenz

Alle acht Wörterbücher stehen unter CC0 — Public Domain. Nutzen Sie sie ohne Einschränkung oder Namensnennung. Das Tool selbst ist Closed Source, aber die Daten gehören Ihnen.

Bereit zum Testen?

Anglizismen-Check öffnen →