diff --git a/pages/students/2024/adrian_ondra/README.md b/pages/students/2024/adrian_ondra/README.md new file mode 100644 index 00000000..d7323914 --- /dev/null +++ b/pages/students/2024/adrian_ondra/README.md @@ -0,0 +1,27 @@ +--- +title: Adrián Ondra +published: true +taxonomy: + category: [bp2027] + tag: [nlp,mind-maps,information-extraction] + author: Daniel Hladek +--- + + +rok začiatku štúdia: 2024 + +# Bakalársky projekt 2027 + +Automatická tvorba myšlienkových máp + +Predbežné úlohy: + +- Naučte sa Python, nainštalujte si Anaconda +- Zistite, ako funguje entity recognition a dependency parsing, a ako sa tieto techniky dajú využiť na identifikáciu kľúčových pojmov a ich vzťahov. Napíšte krátku správu (2-3 strany) s relevantnými vedeckými článkami +- Oboznámte sa s nástrojmi na vizualizáciu grafov a knowledge graphov (napr. [NetworkX](https://networkx.org/), [Graphviz](https://graphviz.org/)) + +Možné ciele semestrálneho projektu: + +- Implementovať pipeline na extrakciu kľúčových pojmov a ich vzťahov zo vstupného textu. +- Vytvoriť vizualizáciu myšlienkovej mapy z automaticky extrahovaných entít. +- Porovnať rôzne metódy extrakcie kľúčových slov a zhodnotiť ich vhodnosť pre generovanie myšlienkových máp. diff --git a/pages/students/2024/samuel_stucka/README.md b/pages/students/2024/samuel_stucka/README.md new file mode 100644 index 00000000..30da0b01 --- /dev/null +++ b/pages/students/2024/samuel_stucka/README.md @@ -0,0 +1,26 @@ +--- +title: Samuel Štucka +published: true +taxonomy: + category: [bp2027] + tag: [nlp,corpus,text-processing] + author: Daniel Hladek +--- + + +rok začiatku štúdia: 2024 + +# Bakalársky projekt 2027 + +Tvorba a spracovanie korpusu novinových článkov + + +Predbežné úlohy: + +- Naučte sa Python, nainštalujte si Anaconda +- Oboznámte sa s metódami získavania a extrakcie textu z HTML novinových článkov (napr. [Readability](https://github.com/buriy/python-readability), [Trafilatura](https://github.com/adbar/trafilatura)) + +Možné ciele semestrálneho projektu: + +- Pripraviť čistý korpus novinových článkov s metadata informáciami. +- Implementovať pipeline na extrakciu a normalizáciu textu z rôznych zdrojov. diff --git a/pages/students/2024/sebastian_kiss/README.md b/pages/students/2024/sebastian_kiss/README.md new file mode 100644 index 00000000..2b48bff8 --- /dev/null +++ b/pages/students/2024/sebastian_kiss/README.md @@ -0,0 +1,27 @@ +--- +title: Sebastián Kišš +published: true +taxonomy: + category: [bp2027] + tag: [multimodal,dataset,evaluation] + author: Daniel Hladek +--- + + +rok začiatku štúdia: 2024 + +# Bakalársky projekt 2027 + +Dáta pre vyhodnotenie multimodálnych jazykových modelov + +Úlohy: + +- Naučte sa Python, nainštalujte si Anaconda +- Oboznámte sa s knižnicou [Hugging Face Datasets](https://huggingface.co/docs/datasets) a metódami hodnotenia multimodálnych modelov. Zistite, čo sú multimodálne jazykové modely (napr. BLIP, LLaVA, FLAN-PaLM). Ako sa hodnotí kvalita multimodálnych výstupov? Napíšte krátku správu (2-3 strany) s relevantnými vedeckými článkami +- Oboznámte sa s existujúcimi multimodálnymi benchmarkmi (VQA, Visual Question Answering, Image Captioning) + +Možné ciele semestrálneho projektu: + +- Pripraviť nový evalučný dátový súbor pre multimodálne jazykové modely. +- Vytvoriť benchmark na porovnanie kvality výstupov rôznych multimodálnych modelov. +- Implementovať automatickú metriku na hodnotenie semantickej zhody medzi textovými a vizuálnymi reprezentáciami. diff --git a/pages/students/2024/yehor_piliavin/README.md b/pages/students/2024/yehor_piliavin/README.md new file mode 100644 index 00000000..6544368e --- /dev/null +++ b/pages/students/2024/yehor_piliavin/README.md @@ -0,0 +1,28 @@ +--- +title: Yehor Piliavin +published: true +taxonomy: + category: [bp2027] + tag: [llm,alignment,steering-vectors] + author: Daniel Hladek +--- + + +rok začiatku štúdia: 2024 + +# Bakalársky projekt 2027 + +Úprava generovania vo veľkých jazykových modeloch pomocou riadiacich vektorov + +Predbežné úlohy: + +- Naučte sa [Python](https://student.kemt.fei.tuke.sk/python/home) +- Zistite, ako funguje neurónová sieť typu Transformer a ako sa trénuje veľký jazykový model. Napíšte o tom krátku správu (2 alebo 3 strany) kde uvediete aj relevantné vedecké články +- Oboznámte sa s konceptom [steering vectors](https://arxiv.org/abs/2310.05915) -- ako sa vytvárajú, ako ovplyvňujú generovanie jazykových modelov +- Pozrite sa na prácu s latentnými reprezentáciami v Transformeroch (napr. attention mechanisms, intermediate layer activations) + +Možné ciele semestrálneho projektu: + +- Vyvinúť metódu na vytváranie riadiacich vektorov pre konkrétne vlastnosti generovania. +- Implementovať a vyhodnotiť vplyv steering vectors na kvalitu a štýl výstupov LLM. +- Nájsť spôsob ako kombinovať viaceré steering vektory pre súčasné riadenie viacerých aspektov generovania.