Méthodologie du vérificateur d'anglicismes

Divulgation complète du calcul du score de clarté : formule, pondérations, sources de dictionnaires et choix de tokenisation. Aucune boîte noire — chaque chiffre est transparent et reproductible.

📐 Formule de notation

La note finale est un nombre de 0 à 100. Elle se calcule sur une densité lissée de correspondances pondérées : le poids de chacune dépend de la gravité, de la hiérarchie de nécessité, du domaine et du contexte (pour les homonymes).

poids = GRAVITÉ[niveau] × NÉCESSITÉ[tier] × facteur_domaine × contexte × sévérité pondéré = Σ poids contexte : exact=1.0, possible=0.3, sens_français=0 densité = pondéré / ( nombre_de_mots + 60 ) ← lissage pour les textes courts pénalité = 100 × densité / ( densité + 0.04 ) note = max( 0 , round( 100 − pénalité ) )

Chaque correspondance n'est comptée qu'une fois ; les locutions de plusieurs mots comptent pour une seule. Les homonymes sont évalués selon le contexte : non pénalisés au sens français, avec souplesse si ambigu. Le lissage et une courbe progressive rendent la note stable selon la longueur du texte et comparable d'un texte à l'autre.

⚖️ Pondérations et facteurs

Le poids d'une correspondance résulte de la gravité, de la hiérarchie de nécessité (modèle VDS), du domaine et de la sévérité. Toutes les valeurs sont codées en dur et identiques pour toutes les langues.

Niveau de sévérité

NiveauPondérationSignification
low0.5Emprunt naturalisé ou neutre (« manager »).
medium1.0OK dans certains contextes, redondant dans d'autres (« content »).
high2.0Entièrement remplaçable par un mot natif sans perte (« deadline »).

Mode de sévérité

ModeFacteurSignification
lax×0.6Souple (×0.6). Ignore les emprunts admis dans le domaine.
balanced×1.0Équilibrée (×1.0, par défaut). Compte tout, mais avec souplesse.
strict×1.6Stricte (×1.6). Plus exigeante.
purist×2.4Puriste (×2.4). Aucune indulgence, même pour les mots naturalisés.

Hiérarchie de nécessité (tier) — modèle VDS Anglizismenindex

ModificateurFacteurQuand appliqué
Indispensable (×0.15)×0.15Aucun équivalent exact en français — terminologie. Pénalité quasi nulle.
Nuance (×0.5)×0.5Apporte une nuance ou bien acclimaté. Pénalité réduite de moitié.
Évitable (×1.0)×1.0Il existe un équivalent français à part entière. Poids plein.

Modificateurs

ModificateurFacteurQuand appliqué
Domaine compatible (×0.4)×0.4Mot admis dans le domaine choisi (par exemple, un terme informatique dans un texte informatique).
Contexte de l'homonyme×1.0 / ×0.3 / 0Pour les homonymes : sens exact ×1.0, ambigu ×0.3, sens français — non compté.

🎯 Notes littérales

Le score numérique est mappé sur une lettre pour une lecture rapide. Les bornes sont codées en dur :

A
90–100
Excellent
B
75–89
Bon
C
60–74
Mitigé
D
40–59
Faible
F
0–39
Fortement emprunté

🧠 Tokenisation & filtrage du bruit

Avant la correspondance, nous masquons les fragments qui ressemblent à des mots mais n'en sont pas. Le masquage préserve les offsets sources pour que la mise en évidence reste précise.

  • URL (https://…) — entièrement masquées, donc nous ne signalons pas « site » dans « https://site.com ».
  • Adresses e-mail — idem.
  • @mentions et #hashtags — sautés en tant que balisage social.
  • Code en ligne `code` entre backticks — ignoré.
  • Identifiants camelCase et snake_case — ignorés en tant que code.
  • Les expressions multi-mots (par ex. « user experience ») sont mises en correspondance avant les mots simples et consomment leurs tokens, donc elles ne comptent pas deux fois.
  • Les marques connues et noms propres (Apple, Yandex, ChatGPT) sont sautés. La liste s'étend par langue via `meta.brands`.

📚 Dictionnaires par langue

Tous les dictionnaires sont librement disponibles en JSON. Utilisez-les dans vos projets, citez-les dans la recherche, envoyez des corrections.

Les entrées fréquemment citées portent leur propre source (`src`) — visible dans l'infobulle mot par mot. À mesure que la sélection progresse, nous ajoutons une citation par entrée à chacune.

Russe 2805 · v2026-07-23-r5 · CC0

Sources
  • RAN reference dictionaries
  • Gramota.ru
  • VDS Anglizismenindex (cross-ref)
  • НКРЯ (Национальный корпус русского языка)
  • Словарь молодёжного сленга 2020-25

Allemand 1187 · v2026-07-16-de2 · CC0

Sources
  • VDS Anglizismenindex (cross-ref)
  • Duden Fremdwörterbuch (descriptive)
  • VDS Anglizismenindex
  • Duden
  • Wahrig Fremdwörterlexikon
  • Goethe-Institut Wortschatz

Français 2460 · v2026-07-16-fr1 · CC0

Sources
  • Académie française — Dire, ne pas dire
  • OQLF Vitrine linguistique
  • TERMIUM Plus
  • Larousse
  • FranceTerme (CULTURE.FR)
  • Office québécois de la langue française (OQLF)
  • Le Robert

Espagnol 968 · v2026-07-16-es1 · CC0

Sources
  • RAE Diccionario panhispánico de dudas
  • Fundéu RAE
  • Diccionario de la lengua española (DRAE)
  • RAE — Diccionario de la lengua española
  • RAE — Diccionario panhispánico de dudas
  • Fundéu BBVA
  • CORPES XXI
  • Banco de neologismos del CSIC

Portugais 1030 · v2026-07-16-pt1 · CC0

Sources
  • Academia Brasileira de Letras (ABL)
  • Ciberdúvidas da Língua Portuguesa
  • Vocabulário Ortográfico da Língua Portuguesa (VOLP)
  • Priberam
  • Houaiss
  • Aulete
  • Acordo Ortográfico de 1990

Coréen 767 · v2026-07-16-ko1 · CC0

Sources
  • 국립국어원 외래어 표기 용례
  • 국립국어원 우리말 다듬기
  • 표준국어대사전
  • 국립국어원 (NIKL)
  • 우리말샘
  • 외래어 표기법
  • 한국어 어문 규범

Indonésien 745 · v2026-07-16-id1 · CC0

Sources
  • KBBI (Kamus Besar Bahasa Indonesia)
  • Badan Bahasa — Pedoman Padanan Istilah Asing
  • Pusat Bahasa
  • Badan Pengembangan dan Pembinaan Bahasa
  • Tata Bahasa Baku Bahasa Indonesia

Arabe 663 · v2026-07-16-ar1 · CC0

Sources
  • مجمع اللغة العربية بالقاهرة
  • مجمع اللغة العربية الأردني
  • معجم الوسيط
  • المعجم العربي الأساسي
  • مجمع اللغة العربية في دمشق
  • معجم اللغة العربية المعاصرة

🤝 Honnêtes sur nos limites

Nous voulons être une référence — nous sommes donc transparents sur ce que l'outil fait et ne fait pas.

Ce que nous ne faisons pas encore : La lemmatisation est approximative (regex sur racine et terminaisons). Les noms propres ne sont pas entièrement séparés — « Site Smith » pourrait être signalé. La grammaire contextuelle n'est pas prise en compte. Ces améliorations sont dans la feuille de route ; en attendant, le mode le plus fiable est la sévérité Équilibré avec naturalisé activé.

📜 Licence

Les huit dictionnaires sont publiés sous CC0 — domaine public. Utilisez-les sans restriction ni attribution. L'outil lui-même est à code fermé, mais les données sont à vous.