Metodologi Pemeriksa Kata Serapan

Pengungkapan penuh tentang cara kami menghitung skor kejernihan: rumus, bobot, sumber kamus dan keputusan tokenisasi. Tanpa kotak hitam — setiap angka transparan dan dapat direproduksi.

📐 Rumus skor

Skor akhir berupa angka 0 sampai 100. Dihitung dari kepadatan terhalus kecocokan berbobot: bobot tiap kata bergantung pada tingkat keparahan, hierarki keperluan, domain, dan konteks (untuk homonim).

bobot = KEPARAHAN[tingkat] × KEBUTUHAN[tier] × faktor_domain × konteks × ketegasan terbobot = Σ bobot konteks: tepat=1.0, mungkin=0.3, makna_asli=0 kepadatan = terbobot / ( jumlah_kata + 60 ) ← penghalusan untuk teks pendek penalti = 100 × kepadatan / ( kepadatan + 0.04 ) skor = max( 0 , round( 100 − penalti ) )

Setiap kecocokan dihitung sekali; frasa banyak kata dihitung sebagai satu. Homonim dinilai menurut konteks: makna asli tak dikurangi nilai, makna ambigu dikurangi ringan. Penghalusan dan kurva landai membuat skor stabil terhadap panjang teks dan dapat dibandingkan antarteks.

⚖️ Bobot dan faktor

Bobot kecocokan terdiri atas tingkat keparahan, hierarki keperluan (model VDS), domain, dan ketegasan. Semua nilai tertanam dalam kode dan sama untuk semua bahasa.

Tingkat keparahan

TingkatBobotArti
low0.5Serapan ternaturalisasi atau netral ("manajer").
medium1.0OK dalam beberapa konteks, berlebihan di lain ("konten").
high2.0Sepenuhnya dapat diganti kata asli tanpa kehilangan ("deadline").

Mode ketat

ModeFaktorArti
lax×0.6Longgar (×0.6). Mengabaikan serapan yang wajar dalam domain.
balanced×1.0Seimbang (×1.0, bawaan). Menghitung semua, tapi ringan.
strict×1.6Ketat (×1.6). Menilai lebih tegas.
purist×2.4Puris (×2.4). Tanpa kelonggaran bahkan untuk kata yang sudah dinaturalisasi.

Hierarki keperluan (tier) — model VDS Anglizismenindex

PengubahFaktorKapan diterapkan
Diperlukan (×0.15)×0.15Tak ada padanan tepat dalam bahasa Indonesia — istilah teknis. Nyaris tak dikurangi nilai.
Bernuansa (×0.5)×0.5Menambah nuansa atau sudah lazim. Dikurangi separuh.
Bisa dihindari (×1.0)×1.0Ada padanan utuh dalam bahasa Indonesia. Bobot penuh.

Pengubah

PengubahFaktorKapan diterapkan
Domain sesuai (×0.4)×0.4Kata wajar dalam domain terpilih (misalnya istilah TI dalam teks TI).
Konteks homonim×1.0 / ×0.3 / 0Untuk homonim: makna tepat ×1.0, ambigu ×0.3, makna asli — tidak dihitung.

🎯 Nilai huruf

Skor numerik dipetakan ke huruf untuk orientasi cepat. Batasnya dikodekan tetap:

A
90–100
Sangat baik
B
75–89
Baik
C
60–74
Campuran
D
40–59
Lemah
F
0–39
Pinjaman berat

🧠 Tokenisasi & filter noise

Sebelum mencocokkan, kami menyamarkan fragmen yang terlihat seperti kata tetapi bukan. Penyamaran mempertahankan offset asli sehingga sorotan tetap akurat.

  • URL (https://…) — disamarkan seluruhnya, agar "site" di "https://site.com" tidak ditandai.
  • Alamat email — sama.
  • @mention dan #hashtag — dilewati sebagai markup sosial.
  • Kode `inline` dalam backtick — diabaikan.
  • Identifier camelCase dan snake_case — diabaikan sebagai kode.
  • Frasa multi-kata (mis. "user experience") dicocokkan sebelum kata tunggal dan menyerap tokennya, jadi tidak dihitung dua kali.
  • Merek dan nama diri terkenal (Apple, Yandex, ChatGPT) dilewati. Daftar diperluas per bahasa melalui `meta.brands`.

📚 Kamus per bahasa

Semua kamus tersedia sebagai JSON. Gunakan di proyek Anda, kutip dalam riset, kirim koreksi.

Entri yang sering dirujuk memiliki sumber sendiri (`src`) — terlihat di popover per kata. Seiring kurasi berkembang, kami menambahkan sumber per entri.

Rusia 2805 · v2026-07-23-r5 · CC0

Sumber
  • RAN reference dictionaries
  • Gramota.ru
  • VDS Anglizismenindex (cross-ref)
  • НКРЯ (Национальный корпус русского языка)
  • Словарь молодёжного сленга 2020-25

Jerman 1187 · v2026-07-16-de2 · CC0

Sumber
  • VDS Anglizismenindex (cross-ref)
  • Duden Fremdwörterbuch (descriptive)
  • VDS Anglizismenindex
  • Duden
  • Wahrig Fremdwörterlexikon
  • Goethe-Institut Wortschatz

Prancis 2460 · v2026-07-16-fr1 · CC0

Sumber
  • Académie française — Dire, ne pas dire
  • OQLF Vitrine linguistique
  • TERMIUM Plus
  • Larousse
  • FranceTerme (CULTURE.FR)
  • Office québécois de la langue française (OQLF)
  • Le Robert

Spanyol 968 · v2026-07-16-es1 · CC0

Sumber
  • RAE Diccionario panhispánico de dudas
  • Fundéu RAE
  • Diccionario de la lengua española (DRAE)
  • RAE — Diccionario de la lengua española
  • RAE — Diccionario panhispánico de dudas
  • Fundéu BBVA
  • CORPES XXI
  • Banco de neologismos del CSIC

Portugis 1030 · v2026-07-16-pt1 · CC0

Sumber
  • Academia Brasileira de Letras (ABL)
  • Ciberdúvidas da Língua Portuguesa
  • Vocabulário Ortográfico da Língua Portuguesa (VOLP)
  • Priberam
  • Houaiss
  • Aulete
  • Acordo Ortográfico de 1990

Korea 767 · v2026-07-16-ko1 · CC0

Sumber
  • 국립국어원 외래어 표기 용례
  • 국립국어원 우리말 다듬기
  • 표준국어대사전
  • 국립국어원 (NIKL)
  • 우리말샘
  • 외래어 표기법
  • 한국어 어문 규범

Indonesia 745 · v2026-07-16-id1 · CC0

Sumber
  • KBBI (Kamus Besar Bahasa Indonesia)
  • Badan Bahasa — Pedoman Padanan Istilah Asing
  • Pusat Bahasa
  • Badan Pengembangan dan Pembinaan Bahasa
  • Tata Bahasa Baku Bahasa Indonesia

Arab 663 · v2026-07-16-ar1 · CC0

Sumber
  • مجمع اللغة العربية بالقاهرة
  • مجمع اللغة العربية الأردني
  • معجم الوسيط
  • المعجم العربي الأساسي
  • مجمع اللغة العربية في دمشق
  • معجم اللغة العربية المعاصرة

🤝 Jujur tentang batasan

Kami ingin menjadi rujukan — jadi kami berterus-terang tentang apa yang dilakukan dan tidak dilakukan alat ini.

Yang belum kami lakukan: Lematisasi masih perkiraan (regex pada akar dan akhiran). Nama diri tidak dipisahkan sepenuhnya. Tata bahasa kontekstual tidak dipertimbangkan. Peningkatan ini ada di roadmap; sebelum dirilis, mode paling andal adalah keketatan Seimbang dengan ternaturalisasi diaktifkan.

📜 Lisensi

Kedelapan kamus dirilis di bawah CC0 — domain publik. Gunakan tanpa batasan atau atribusi. Alatnya sendiri tertutup, tetapi datanya milik Anda.