← Všechny projekty
Strojové učení

Tiny Language Classifier

Rychlý klasifikátor Naivního Bayese pro identifikaci jazyka textu.

KategorieStrojové učení
Aktualizováno17. 10. 2025
Repozitářhttps://github.com/martinledl/language-identification/
Technologie
AIMachine LearningHugging FaceScikit-LearnNumPyPandas

Přehled

Tiny Language Classifier jsem vytvořil, abych vyzkoušel, jak dobře dokáže jednoduchý klasifikátor Naivního Bayese rozpoznat jazyk textu.

Nejde o žádný velký projekt, ale myslím, že sahání po zbytečně složitých modelech pro jednoduché úlohy je dnes v oblasti strojového učení na denním pořádku.

Detaily projektu

Model byl natrénován a otestován na datasetu pro identifikaci jazyka dostupném na Hugging Face. Textová data jsou vektorizována a předána klasifikátoru Naivního Bayese (MultinomialNB) z knihovny Scikit-Learn.

I přes svou jednoduchost model dosáhl působivé přesnosti přes 90 % na testovací sadě.

Použité technologie

  • Python
  • Scikit-Learn
  • NumPy
  • Pandas
  • Hugging Face (datasety)