Metodología del detector de anglicismos

Divulgación completa de cómo calculamos la puntuación de claridad: fórmula, pesos, fuentes de diccionarios y decisiones de tokenización. Sin cajas negras — cada número es transparente y reproducible.

📐 Fórmula de puntuación

La puntuación final es un número de 0 a 100. Se calcula a partir de la densidad suavizada de coincidencias ponderadas: el peso de cada una depende de la gravedad, la jerarquía de necesidad, el dominio y el contexto (en palabras homónimas).

peso = GRAVEDAD[nivel] × NECESIDAD[tier] × factor_dominio × contexto × rigor ponderado = Σ peso contexto: exacto=1.0, posible=0.3, sentido_español=0 densidad = ponderado / ( número_de_palabras + 60 ) ← suavizado para textos cortos penalización = 100 × densidad / ( densidad + 0.04 ) puntuación = max( 0 , round( 100 − penalización ) )

Cada coincidencia cuenta una sola vez; las frases de varias palabras, como una. Las palabras homónimas se evalúan según el contexto: en su sentido propio del español no penalizan; en el ambiguo, con suavidad. El suavizado y una curva gradual hacen que la puntuación sea estable frente a la longitud del texto y comparable entre textos.

⚖️ Pesos y factores

El peso de una coincidencia combina la gravedad, la jerarquía de necesidad (modelo VDS), el dominio y la severidad. Todos los valores están fijados en el código y son iguales para todos los idiomas.

Nivel de gravedad

NivelPesoSignificado
low0.5Préstamo naturalizado o neutral ("manager").
medium1.0OK en algunos contextos, redundante en otros ("contenido").
high2.0Totalmente reemplazable por palabra nativa sin pérdida ("deadline").

Modo de rigor

ModoFactorSignificado
lax×0.6Indulgente (×0.6). Ignora los préstamos admisibles dentro del dominio.
balanced×1.0Equilibrada (×1.0, por defecto). Cuenta todo, pero con suavidad.
strict×1.6Estricta (×1.6). Exige más rigor.
purist×2.4Purista (×2.4). Ninguna concesión, ni siquiera a los términos naturalizados.

Jerarquía de necesidad (tier) — modelo VDS Anglizismenindex

ModificadorFactorCuándo se aplica
Necesario (×0.15)×0.15Sin equivalente exacto en español: es terminología. Apenas penaliza.
Matiz (×0.5)×0.5Aporta un matiz o ya está asentado. Penaliza a la mitad.
Evitable (×1.0)×1.0Tiene un equivalente pleno en español. Peso completo.

Modificadores

ModificadorFactorCuándo se aplica
Dominio compatible (×0.4)×0.4La palabra es admisible en el dominio elegido (por ejemplo, un término de TI en un texto de TI).
Contexto del homónimo×1.0 / ×0.3 / 0En palabras homónimas: sentido exacto ×1.0, ambiguo ×0.3, sentido propio del español: no cuenta.

🎯 Calificaciones por letra

La puntuación numérica se mapea a una letra para orientación rápida. Los límites están fijos en el código:

A
90–100
Excelente
B
75–89
Bueno
C
60–74
Mixto
D
40–59
Pobre
F
0–39
Muy prestado

🧠 Tokenización y filtro de ruido

Antes de buscar coincidencias enmascaramos fragmentos que parecen palabras pero no lo son. El enmascaramiento conserva los desplazamientos originales para que el resaltado siga siendo preciso.

  • URLs (https://…) — enmascaradas por completo para no marcar "site" dentro de "https://site.com".
  • Correos electrónicos — igual.
  • Menciones @ y hashtags # — saltados como marcado social.
  • Código `inline` en backticks — ignorado.
  • Identificadores camelCase y snake_case — ignorados como código.
  • Frases multipalabra (ej. "user experience") se emparejan antes que palabras sueltas y consumen sus tokens, así no cuentan dos veces.
  • Marcas conocidas y nombres propios (Apple, Yandex, ChatGPT) se omiten. La lista se extiende por idioma vía `meta.brands`.

📚 Diccionarios por idioma

Todos los diccionarios están disponibles libremente en JSON. Úsalos en tus proyectos, cítalos en investigación, envía correcciones.

Las entradas frecuentemente citadas llevan su propia fuente (`src`) — visible en el popover por palabra. Conforme avanza la curación añadimos cita propia a cada entrada.

Ruso 2805 · v2026-07-23-r5 · CC0

Fuentes
  • RAN reference dictionaries
  • Gramota.ru
  • VDS Anglizismenindex (cross-ref)
  • НКРЯ (Национальный корпус русского языка)
  • Словарь молодёжного сленга 2020-25

Alemán 1187 · v2026-07-16-de2 · CC0

Fuentes
  • VDS Anglizismenindex (cross-ref)
  • Duden Fremdwörterbuch (descriptive)
  • VDS Anglizismenindex
  • Duden
  • Wahrig Fremdwörterlexikon
  • Goethe-Institut Wortschatz

Francés 2460 · v2026-07-16-fr1 · CC0

Fuentes
  • Académie française — Dire, ne pas dire
  • OQLF Vitrine linguistique
  • TERMIUM Plus
  • Larousse
  • FranceTerme (CULTURE.FR)
  • Office québécois de la langue française (OQLF)
  • Le Robert

Español 968 · v2026-07-16-es1 · CC0

Fuentes
  • RAE Diccionario panhispánico de dudas
  • Fundéu RAE
  • Diccionario de la lengua española (DRAE)
  • RAE — Diccionario de la lengua española
  • RAE — Diccionario panhispánico de dudas
  • Fundéu BBVA
  • CORPES XXI
  • Banco de neologismos del CSIC

Portugués 1030 · v2026-07-16-pt1 · CC0

Fuentes
  • Academia Brasileira de Letras (ABL)
  • Ciberdúvidas da Língua Portuguesa
  • Vocabulário Ortográfico da Língua Portuguesa (VOLP)
  • Priberam
  • Houaiss
  • Aulete
  • Acordo Ortográfico de 1990

Coreano 767 · v2026-07-16-ko1 · CC0

Fuentes
  • 국립국어원 외래어 표기 용례
  • 국립국어원 우리말 다듬기
  • 표준국어대사전
  • 국립국어원 (NIKL)
  • 우리말샘
  • 외래어 표기법
  • 한국어 어문 규범

Indonesio 745 · v2026-07-16-id1 · CC0

Fuentes
  • KBBI (Kamus Besar Bahasa Indonesia)
  • Badan Bahasa — Pedoman Padanan Istilah Asing
  • Pusat Bahasa
  • Badan Pengembangan dan Pembinaan Bahasa
  • Tata Bahasa Baku Bahasa Indonesia

Árabe 663 · v2026-07-16-ar1 · CC0

Fuentes
  • مجمع اللغة العربية بالقاهرة
  • مجمع اللغة العربية الأردني
  • معجم الوسيط
  • المعجم العربي الأساسي
  • مجمع اللغة العربية في دمشق
  • معجم اللغة العربية المعاصرة

🤝 Honestidad sobre limitaciones

Queremos ser una referencia — así que somos directos sobre lo que la herramienta hace y lo que aún no.

Lo que aún no hacemos: La lematización es aproximada (regex sobre raíz y terminaciones). Los nombres propios no se separan completamente. La gramática contextual no se considera. Estas mejoras están en la hoja de ruta; hasta que se publiquen, el modo más fiable es Equilibrado con naturalizados activado.

📜 Licencia

Los ocho diccionarios se publican bajo CC0 — dominio público. Úsalos sin restricción ni atribución. La herramienta en sí es código cerrado, pero los datos son tuyos.

¿Listo para probar?

Abrir Detector de anglicismos →