Přehled
Tiny Language Classifier jsem vytvořil, abych vyzkoušel, jak dobře dokáže jednoduchý klasifikátor Naivního Bayese rozpoznat jazyk textu.
Nejde o žádný velký projekt, ale myslím, že sahání po zbytečně složitých modelech pro jednoduché úlohy je dnes v oblasti strojového učení na denním pořádku.
Detaily projektu
Model byl natrénován a otestován na datasetu pro identifikaci jazyka dostupném na Hugging Face. Textová data jsou vektorizována a předána klasifikátoru Naivního Bayese (MultinomialNB) z knihovny Scikit-Learn.
I přes svou jednoduchost model dosáhl působivé přesnosti přes 90 % na testovací sadě.
Použité technologie
- Python
- Scikit-Learn
- NumPy
- Pandas
- Hugging Face (datasety)