diff --git a/pages/students/2022/andrii_pervashov/README.md b/pages/students/2022/andrii_pervashov/README.md index fb09aadf..b8ca41a7 100644 --- a/pages/students/2022/andrii_pervashov/README.md +++ b/pages/students/2022/andrii_pervashov/README.md @@ -35,11 +35,28 @@ Teoretické úlohy: - Oboznámte sa s postupmi pre dotrénovanie jazykového modelu - LORA, PEFT. - Oboznámte sa s metódami Information Extraction. Vyhľadajte si články na túto tému a napíšte, aké metódy sa používajú. Vstupom je text v prir. jazyku, výstupom je niečo ako JSON. - Zásobník úloh: - Vyskúšajte ako funguje rozpoznávanie reči cez OPeWEBUI. Navrhnute zlepšenia. - Ako vieme zistiť, ktoré informácie nám chýbajú? +Stretnutie 24.9.2026 + +Stav: + +- Urobený deployment na http://147.232.204.160:3000/ +- Prečítané základy Lora a information extraction podľa inštrukcií. + +Úlohy: + +- Presne špecifikovať scenár, ktorý riešime pomocou akustického a jazykového modelu. Nemusí byť z medicínskej oblasti. +- Pohľadajte vhodnú existujúcu dátovú množinu pre tento scenár. Nemusí byť po slovensky. Príkladom môžu byť úlohy súvisiace s prepisom stretnutí - meeting speech. Ako zdroje použite Huggingface, Kaggle, Clarin, ELRA. Nájdite viac podobných množin. +- Použite existujúci prepisovať a jazykový model pre riešenie tejto úlohy. +- Použite trénovaciu časť tejto množiny pre zlepšenie aktuálnych modelov. Môžete využiť PEFT alebo RAG. +- Do písomnej časti napíšte definíciu úlohy, prehľad existujúcich dátových množín, prehľad metód riešenia definovanej úlohy a opis Vášho riešenia. +- Otestujte Vaše riešenie na testovacej časti dátovej množiny. + + + Stretnutie 10.6.2026 Stav: