dmytro_ushatenko/pages/students/2022/valerii_kutsenko/README.md

2.7 KiB

title published taxonomy
Valerii Kutsenko true
category tag author
vp2024
bp2025
rag
nlp
Daniel Hladek

rok začiatku štúdia: 2022

Bakalárska práca 2025

Cieľ je vylepšiť slovenský model pre generovanie vektrovej reprezentácie. vylepšiť proces RAG: Generovanie jazyka s pomocou vyhľadávania -Retrieval augmented generation

Nové nápady:

  • Vytvorte systém pre generovanie otázok o zadanom texte.
  • Vytvorte umelo generovanú množinu otázok a odpovedí.
  • Pomocou umelej množiny zlepšite existujúci systém pre otázky a odpovede.

Ako na to:

  • Natrénujte generatívny model pre generovanie otázok. Použite existujúci skript a množinu SKQUAD.
  • Určite, ktorá otázka je dobre vygenerovaná a ktorá nie. Tu môžete použiť: systém pre vyhľadávanie alebo neurónovú sieť pre otázky a odpovede. Ku otázke viete nájsť odpovede pomocou neurónovej siete. Výstupom by mala byť čo najkvalitnejšia množina otázok a dpovedí ku odsekom.
  • Výstupom by mala byť umelo generovaná datqabáza otázok a odpovedí.

Úlohy:

Staré Nápady:

  • Možno pomocou vytvorenia-prekladu vlastnej trénovacej databázy.
  • alebo pomocou nekontrolovaného učenia, reps. augmentácie alebo generovania.
  • Alebo zber trénovacích dát z webového korpusu.
  • Sústrediť sa na vektrovú reprezentáciu dokumentov?

Úlohy na semester - "nepovinné, oficiálne sa to začne na zimný semester 2024"

  • Zistite čo je to Retrieval Augmented Generation a napíšte o tom správu.
  • Naučte sa základy jazyka Python.
  • Napíšte krátky report na 2 strany kde napíšete čo ste urobili a čo ste sa dozvedeli.

Stretnutie 9.5.24

Stav:

  • Naštudované Deep dive intoi Python a dl2ai, niečo o RAG.

Úlohy:

Stretnutie 22.3.

Úlohy:

  • Nainštalujte si prostredie Anaconda. Prejdite si knihu Dive Deep into Python 3.
  • Prečítajte si knihu https://d2l.ai/ a napíšte si poznámky.
  • Zistite ako funguje RAG. Zistite ako funguje ChatGPT. Zistite ako funguje vyhľadávanie pomocou SentenceTranformers. Napíšte o tom poznámky.
  • Skúste si tento tutoriál o LangChain

Zásobník úloh:

  • Nainštalujte si PrivateGPT.