Metodología del detector de anglicismos
Divulgación completa de cómo calculamos la puntuación de claridad: fórmula, pesos, fuentes de diccionarios y decisiones de tokenización. Sin cajas negras — cada número es transparente y reproducible.
📐 Fórmula de puntuación
La puntuación final es un número de 0 a 100. Se calcula a partir de la densidad suavizada de coincidencias ponderadas: el peso de cada una depende de la gravedad, la jerarquía de necesidad, el dominio y el contexto (en palabras homónimas).
Cada coincidencia cuenta una sola vez; las frases de varias palabras, como una. Las palabras homónimas se evalúan según el contexto: en su sentido propio del español no penalizan; en el ambiguo, con suavidad. El suavizado y una curva gradual hacen que la puntuación sea estable frente a la longitud del texto y comparable entre textos.
⚖️ Pesos y factores
El peso de una coincidencia combina la gravedad, la jerarquía de necesidad (modelo VDS), el dominio y la severidad. Todos los valores están fijados en el código y son iguales para todos los idiomas.
Nivel de gravedad
| Nivel | Peso | Significado |
|---|---|---|
| low | 0.5 | Préstamo naturalizado o neutral ("manager"). |
| medium | 1.0 | OK en algunos contextos, redundante en otros ("contenido"). |
| high | 2.0 | Totalmente reemplazable por palabra nativa sin pérdida ("deadline"). |
Modo de rigor
| Modo | Factor | Significado |
|---|---|---|
| lax | ×0.6 | Indulgente (×0.6). Ignora los préstamos admisibles dentro del dominio. |
| balanced | ×1.0 | Equilibrada (×1.0, por defecto). Cuenta todo, pero con suavidad. |
| strict | ×1.6 | Estricta (×1.6). Exige más rigor. |
| purist | ×2.4 | Purista (×2.4). Ninguna concesión, ni siquiera a los términos naturalizados. |
Jerarquía de necesidad (tier) — modelo VDS Anglizismenindex
| Modificador | Factor | Cuándo se aplica |
|---|---|---|
| Necesario (×0.15) | ×0.15 | Sin equivalente exacto en español: es terminología. Apenas penaliza. |
| Matiz (×0.5) | ×0.5 | Aporta un matiz o ya está asentado. Penaliza a la mitad. |
| Evitable (×1.0) | ×1.0 | Tiene un equivalente pleno en español. Peso completo. |
Modificadores
| Modificador | Factor | Cuándo se aplica |
|---|---|---|
| Dominio compatible (×0.4) | ×0.4 | La palabra es admisible en el dominio elegido (por ejemplo, un término de TI en un texto de TI). |
| Contexto del homónimo | ×1.0 / ×0.3 / 0 | En palabras homónimas: sentido exacto ×1.0, ambiguo ×0.3, sentido propio del español: no cuenta. |
🎯 Calificaciones por letra
La puntuación numérica se mapea a una letra para orientación rápida. Los límites están fijos en el código:
🧠 Tokenización y filtro de ruido
Antes de buscar coincidencias enmascaramos fragmentos que parecen palabras pero no lo son. El enmascaramiento conserva los desplazamientos originales para que el resaltado siga siendo preciso.
- URLs (https://…) — enmascaradas por completo para no marcar "site" dentro de "https://site.com".
- Correos electrónicos — igual.
- Menciones @ y hashtags # — saltados como marcado social.
- Código `inline` en backticks — ignorado.
- Identificadores camelCase y snake_case — ignorados como código.
- Frases multipalabra (ej. "user experience") se emparejan antes que palabras sueltas y consumen sus tokens, así no cuentan dos veces.
- Marcas conocidas y nombres propios (Apple, Yandex, ChatGPT) se omiten. La lista se extiende por idioma vía `meta.brands`.
📚 Diccionarios por idioma
Todos los diccionarios están disponibles libremente en JSON. Úsalos en tus proyectos, cítalos en investigación, envía correcciones.
Las entradas frecuentemente citadas llevan su propia fuente (`src`) — visible en el popover por palabra. Conforme avanza la curación añadimos cita propia a cada entrada.
Ruso 2805 · v2026-07-23-r5 · CC0
- RAN reference dictionaries
- Gramota.ru
- VDS Anglizismenindex (cross-ref)
- НКРЯ (Национальный корпус русского языка)
- Словарь молодёжного сленга 2020-25
Alemán 1187 · v2026-07-16-de2 · CC0
- VDS Anglizismenindex (cross-ref)
- Duden Fremdwörterbuch (descriptive)
- VDS Anglizismenindex
- Duden
- Wahrig Fremdwörterlexikon
- Goethe-Institut Wortschatz
Francés 2460 · v2026-07-16-fr1 · CC0
- Académie française — Dire, ne pas dire
- OQLF Vitrine linguistique
- TERMIUM Plus
- Larousse
- FranceTerme (CULTURE.FR)
- Office québécois de la langue française (OQLF)
- Le Robert
Español 968 · v2026-07-16-es1 · CC0
- RAE Diccionario panhispánico de dudas
- Fundéu RAE
- Diccionario de la lengua española (DRAE)
- RAE — Diccionario de la lengua española
- RAE — Diccionario panhispánico de dudas
- Fundéu BBVA
- CORPES XXI
- Banco de neologismos del CSIC
Portugués 1030 · v2026-07-16-pt1 · CC0
- Academia Brasileira de Letras (ABL)
- Ciberdúvidas da Língua Portuguesa
- Vocabulário Ortográfico da Língua Portuguesa (VOLP)
- Priberam
- Houaiss
- Aulete
- Acordo Ortográfico de 1990
Coreano 767 · v2026-07-16-ko1 · CC0
- 국립국어원 외래어 표기 용례
- 국립국어원 우리말 다듬기
- 표준국어대사전
- 국립국어원 (NIKL)
- 우리말샘
- 외래어 표기법
- 한국어 어문 규범
Indonesio 745 · v2026-07-16-id1 · CC0
- KBBI (Kamus Besar Bahasa Indonesia)
- Badan Bahasa — Pedoman Padanan Istilah Asing
- Pusat Bahasa
- Badan Pengembangan dan Pembinaan Bahasa
- Tata Bahasa Baku Bahasa Indonesia
Árabe 663 · v2026-07-16-ar1 · CC0
- مجمع اللغة العربية بالقاهرة
- مجمع اللغة العربية الأردني
- معجم الوسيط
- المعجم العربي الأساسي
- مجمع اللغة العربية في دمشق
- معجم اللغة العربية المعاصرة
🤝 Honestidad sobre limitaciones
Queremos ser una referencia — así que somos directos sobre lo que la herramienta hace y lo que aún no.
📜 Licencia
Los ocho diccionarios se publican bajo CC0 — dominio público. Úsalos sin restricción ni atribución. La herramienta en sí es código cerrado, pero los datos son tuyos.
¿Listo para probar?
Abrir Detector de anglicismos →