Merge branch 'master' of git.kemt.fei.tuke.sk:KEMT/zpwiki

This commit is contained in:
Daniel Hládek 2026-10-02 10:27:12 +02:00
commit 0ee285f809
5 changed files with 303 additions and 5 deletions

186
pages/AGENTS.md Normal file
View File

@ -0,0 +1,186 @@
# Wiki Content Guide
## Purpose
This Grav wiki manages final theses, semester projects, and internships. Treat its pages as long-lived supervision records rather than polished articles: preserve factual history, make current work easy to find, and distinguish recorded facts from proposed work.
The main content areas are:
- `topics/`: support materials and general project summaries.
- `interns/`: intern profiles.
- `students/<start-year>/`: student profiles grouped by the year in which the student started studying.
## General editing rules
- Preserve the language already used by a page. Student profiles are usually in Slovak; intern profiles may be in English. Use the page's language for new headings and text.
- Preserve valid Grav YAML front matter between `---` delimiters. Do not rename existing taxonomy keys.
- Treat `taxonomy.author` as the supervisor, `taxonomy.tag` as project keywords, and `taxonomy.category` as project-type/year categories such as `bp2027`, `dp2027`, or `vp2026`.
- Use lowercase `first_last` profile directory names without diacritics. Keep the person's correct spelling and diacritics in the front-matter `title`.
- Do not invent names, dates, assignments, status updates, completed work, repository URLs, results, or citations. If required information is missing, leave an explicit placeholder or ask for it.
- Keep links descriptive. Every active student project should have a visible link to its Git repository. Do not mistake a linked dependency, article, dataset, or related project for the student's repository.
- Prefer focused edits. Do not reformat or reorganize a legacy profile unless the task requires it.
- Apply the canonical formats below to new profiles and substantial new project sections. When updating an existing section, follow its established style unless doing so would make the record ambiguous.
## Finding and comparing projects
When searching for a person or project, search across `students/`, `interns/`, and `topics/`, not only the newest cohort. Check:
- profile names and project titles;
- front-matter categories, tags, and authors;
- assignment text, goals, meeting status, and task backlogs;
- Git repository links and links to related wiki topics.
When identifying similar projects, explain the similarity using concrete evidence such as a shared task, domain, dataset, method, model, or evaluation approach. Separate direct predecessors from projects that are only thematically related.
## Creating a student profile
Create a profile at `students/<start-year>/<first_last>/README.md`. Use this baseline:
```markdown
---
title: Full Student Name
published: true
taxonomy:
category: [project_type_and_end_year]
tag: [keyword-one,keyword-two]
author: Supervisor Name
---
rok začiatku štúdia: YYYY
# Project Type YYYY
Názov:
Project title
Repozitár:
- [Git repozitár](https://example.invalid/repository)
Zadanie:
1. First assignment point.
2. Second assignment point.
```
Replace all placeholders before publishing. The year in the project heading and taxonomy category is the project's expected ending year, not the study start year. Add every project represented on the profile to `taxonomy.category`.
Common Slovak project/category names are:
- `Bakalárska práca` / `bpYYYY`
- `Bakalársky projekt` / `bpYYYY`
- `Diplomová práca` / `dpYYYY`
- `Diplomový projekt` / `dpYYYY`
- `Vedecký projekt` / `vpYYYY`
- `Tímový projekt` / `tpYYYY`
Follow an existing nearby profile when another established project type is needed.
## Creating an intern profile
Create a profile at `interns/<first_last>/README.md`. Intern pages normally use the language of supervision and this baseline:
```markdown
---
title: Full Intern Name
published: true
taxonomy:
category: [internship-program]
tag: [keyword-one,keyword-two]
author: Supervisor Name
---
Internship program and period
Goal:
- Primary goal
Repository:
- [Git repository](https://example.invalid/repository)
Tasks:
1. First task.
2. Second task.
```
Record the internship period instead of a student study-start year. Add results, reports, datasets, and model links when they become available.
## Student project sections
A student may have several semester or final projects in one profile. Each project section must make these items identifiable:
- project type and ending year in the heading;
- project title;
- assignment or clearly marked preliminary assignment;
- Git repository link;
- goals or expected outputs when known;
- dated meeting records.
Place the newest/current project first. Keep older project records because they provide context and make related work discoverable.
Do not silently turn preliminary ideas into an approved assignment. Label tentative content with the page's existing terms, for example `Predbežné zadanie`, `Návrh`, `Možné ciele`, or `Nápady`.
## Meeting records
Add new meetings under the relevant project, newest first. Use the page's language. A Slovak record should normally look like:
```markdown
Stretnutie DD.MM.YYYY
Stav:
- Work completed or current observed state.
- Important problem or result.
Úlohy:
- Concrete next action with an observable output.
- Another prioritized action.
Zásobník úloh:
- Lower-priority or possible future work.
```
An English intern record may use `Meeting`, `State`, `Tasks`, and `Future tasks`. Omit an empty optional backlog, but do not omit known status or assigned tasks. Preserve checkbox notation where a page already uses it; never mark a task complete without recorded evidence.
## Writing assignments and proposing tasks
Write project assignments as numbered, outcome-oriented points. A useful assignment normally progresses through:
1. reviewing relevant methods and literature;
2. selecting or preparing data, tools, or an experimental setup;
3. implementing and evaluating the proposed solution;
4. identifying limitations and proposing improvements.
Adapt that sequence to the actual project instead of copying generic wording unchanged. Keep the title, assignment, goals, tasks, and expected artifacts consistent.
When proposing new tasks from a project status:
- read the latest meeting and unresolved earlier tasks first;
- connect each proposal to a recorded problem, result, assignment point, or missing deliverable;
- prioritize the smallest verifiable next steps;
- include expected artifacts such as code, data, tables, experiment results, or written sections;
- reuse relevant methods or resources found in similar projects, with links;
- distinguish immediate tasks from optional ideas or backlog items;
- include updating the Git repository when code or data is produced, without requesting secrets or credentials.
Do not claim that a proposed experiment will improve results. State what it is intended to test and how the result should be evaluated.
## Review checklist
Before finishing a content change, verify that:
- front matter is valid YAML and retains `title`, `published`, and taxonomy data;
- the profile path and study-start year or internship period agree;
- every project heading and category uses the ending year;
- the person's name, supervisor, and keywords are present;
- each active student project has its title, assignment, and Git repository link;
- a new meeting has a date, status, and actionable tasks and is in newest-first order;
- proposed facts are not presented as recorded facts;
- internal and external links are syntactically valid;
- unrelated historical content and formatting were left intact.

View File

@ -10,6 +10,36 @@ taxonomy:
rok začiatku štúdia: 2022 rok začiatku štúdia: 2022
# Diplomová práca 2027
Stretnutie 1.10.ľ2026
Stav:
- vytvorený repozitár s konfiguráciami
- vyskúšaná AYA collection dataset - zbehlo 86 percent datasetu. Kolísala evaluácia.
- vyskúšaná lm-eval a Alpaca.
- Momentálne máme k dispozicii SlovakAlpaca a slovenskú časť AYA colections.
- porovnanie AYA a Alpaca dotrénovania. Alpaca vyzerá lepšie.
- prípravených 10 experimentov s eval a loss priebehom.
- výsledky sú na https://git.kemt.fei.tuke.sk/js886io/Diplomovka
Úlohy:
- Navrhnite scenár pre dotrénovanie jazykového modelu. Ake LORA spôsoby? Ako nastaviť lm factory?
- Pripravte experiment na optimalizáciu hyperparametrov. Najdôležitejší je LR. Na ostetné sa môžete spýtať AI. Tú istú kofiguráciu spúštate s roznym LR v "menšom" experimente a sledujete evall loss. Sledujte aj gradient pre identifikáciu "explosion". Porovnanie má zmysel iba v rámci tohot experimentu.
- Napíšte projekt na HPC Perun.
- Pripravte skript, ktorý zozbiera a pripravý trénovacie dáta, ktoré mame k dispozícii. Dáta rozdeľte na 3 časti. train, test, eval. Test a eval by mali byť tak, nastavené, aby vyhodnotenie na nich netrovalo príáliš dlho. Stačí iba jedna mnoižina ak sú dáta podobné.
- pripravte skript, ktorý vyhodnotí výsledný model. Na vyhodnotenie použite "eval" časť dát.
- napíšte poznámky do DP, kde opíšete metódy ktoré používate - Supervised Fine Tuning, modely ktoré používate, spôsob vyhodnotenie.
Úlohy na neskôr:
- zlepšite trénovacie dáta
- použite vyhodnotenie SK-bench.
- Použite iný multilinguálny model na dotrénovanie - napr. OLMO.
# Diplomový projekt 2026 # Diplomový projekt 2026

View File

@ -10,6 +10,47 @@ taxonomy:
rok začiatku štúdia: 2022 rok začiatku štúdia: 2022
# Diplomová práca 2027
Téma:
Agent pre manažment záverečných prác
Úlohy na semester:
Agent by mal vedieť:
- získať aktuálne dáta z GITU,
- vedieť v nich vyhľadávať a zodpovedať otázky z vyhľadávania.
- vedieť vyhľadávať na CRZP záverečné práce.
- mal by fungovať cez openwebui rozhranie.
- Vytvorte komplenté nasadenie agenta pomocou DockerCompose.
Úlohy do budúcnosti:
- vyhodnotte vyhľadávanie - porovnajte RAG a GraphRAG
- Pripravte testovacei scenáre pre agenta a s ich pomocou vyhodnotte agenta.
Stretnutie 30.9.2026
Stav:
- Funguje RAG systém, prepojenie s OpenWEBUI. Zatiaľ len pomocou agenta - treba zistiť implementačné detaily.
- Používa modely cez ui.tukekemt.xyz - Fast120 (Qwen3.5) a me5mini
- začíname pracovať na GraphRAG a Neo4J
Úlohy:
- Pokračujte v GraphRAG - Naprogramujte načítanie existujúcich Markdown textov do Neo4j — vytvorte uzly pre každú záverečnú prácu, autora, tému a kľúčové slová. Vytvorte grafové relácie medzi uzlami (napr. rovnaký autor → rovnaká téma, rovnaký študijný program)
- Napíšte poznámky o GraphRAG — definícia, ako funguje, rozdiel oproti klasickému RAG, výhody a nevýhody
- Agenta rozdeľte na samostatné komponenty (násttroje - tools alebo skills). Každý nástroj dajte do osobitného adresára na GIte. Každý nástroj by sa mal z gitu dať nainštalovať do OpenWebUI.
- Pridajte aj "hlavného agenta" - prompt, ktorý buyde pracovať s nástrojmi,
- Agenta, ktorý bude vyhľadávať na GITe môžete koncipovať ako MCP server, ktorý bude bežať v Dockeri.
- Obboznámte sa s pojmami MCP, Tool, Skill, AGENTS.md
# Diplomový projekt 2026 # Diplomový projekt 2026

View File

@ -19,8 +19,35 @@ Predbežné úlohy:
- Naučte sa Python, nainštalujte si Anaconda - Naučte sa Python, nainštalujte si Anaconda
- Oboznámte sa s metódami získavania a extrakcie textu z HTML novinových článkov (napr. [Readability](https://github.com/buriy/python-readability), [Trafilatura](https://github.com/adbar/trafilatura)) - Oboznámte sa s metódami získavania a extrakcie textu z HTML novinových článkov (napr. [Readability](https://github.com/buriy/python-readability), [Trafilatura](https://github.com/adbar/trafilatura))
- Pozrite si: wget je nástorj na sťahovanie celých webov alebo ich sekcií. Druhá možnosť je použiť vlastný agent pre sťahovanie.
- Na uloženie textových dát je dobré použiť kombináciu súborového systému a relačnej databázy (sqlite, postresql).
Možné ciele semestrálneho projektu: Možné ciele semestrálneho projektu:
- Pripraviť čistý korpus novinových článkov s metadata informáciami. - Pripraviť čistý korpus novinových článkov s metadata informáciami.
- Korpus by mal uchovať HTML aj obrázky z článkov (bez reklám a rozhrania). Mal by byť získaný "slušným" spôsobom. Mal by extrahovatť čo najviac metainformácií o článkoch - autor, zdroj, dátum vydania, sekcia, kľúčové slovíčka, nadpis, perex. Je dobré zachovať odkazy na obrázky. Ku obrázkom je dobré zachovať titulku, popis.
- Neskôr je možné aplikovať jayzkový model na zistenie alebo doplnenie ďalších metainformácií.
- Neskôr môžeme spracovať aj blogy a diskusné skupiny.
- Môžeme dáta využiť na zlepšenie alebo overenie jazykových modelov.
- Implementovať pipeline na extrakciu a normalizáciu textu z rôznych zdrojov. - Implementovať pipeline na extrakciu a normalizáciu textu z rôznych zdrojov.
Stretnutie 29.9. 2026
Úlohy:
- Učte sa Python, zistite ako prebieha trénovanie a dotrénovanie jazykových modelov. Napíšte krátku správu o tom ako sa trénuje jazykový model a ako sa dajú využiť kvalitné novinové dáta.
- Pozrite si predchádzajúce práce na tomto Wiki súvisiace s textovými a obrázkovými dátami.
- Vytypujte si vhodné zdroje dát - články z servra Pravda. Aké iné noviny sú vhodné?
- Pozrite si ako funguje Internet Archive a Wayback Machine.
- Navrhnite vhodnú SQL relačnú schému.
- skripty a konfiguračné súbory dávajte ne KEMT git repozitár.
- neskôr je možné využiť školský server na uloženie dát.
Zásobník úloh:
- stiahnuť a spracovať blogy.

View File

@ -14,14 +14,28 @@ rok začiatku štúdia: 2024
Dáta pre vyhodnotenie multimodálnych jazykových modelov Dáta pre vyhodnotenie multimodálnych jazykových modelov
Úlohy: Ciel: Vytvoriť a použiť novú dátovú množinu pre vyhodnotenie muliimodálnych modelov s podporou slovenského jazyka
- Naučte sa Python, nainštalujte si Anaconda
- Oboznámte sa s knižnicou [Hugging Face Datasets](https://huggingface.co/docs/datasets) a metódami hodnotenia multimodálnych modelov. Zistite, čo sú multimodálne jazykové modely (napr. BLIP, LLaVA, FLAN-PaLM). Ako sa hodnotí kvalita multimodálnych výstupov? Napíšte krátku správu (2-3 strany) s relevantnými vedeckými článkami
- Oboznámte sa s existujúcimi multimodálnymi benchmarkmi (VQA, Visual Question Answering, Image Captioning)
Možné ciele semestrálneho projektu: Možné ciele semestrálneho projektu:
- Pripraviť nový evalučný dátový súbor pre multimodálne jazykové modely. - Pripraviť nový evalučný dátový súbor pre multimodálne jazykové modely.
- Vytvoriť benchmark na porovnanie kvality výstupov rôznych multimodálnych modelov. - Vytvoriť benchmark na porovnanie kvality výstupov rôznych multimodálnych modelov.
- Implementovať automatickú metriku na hodnotenie semantickej zhody medzi textovými a vizuálnymi reprezentáciami. - Implementovať automatickú metriku na hodnotenie semantickej zhody medzi textovými a vizuálnymi reprezentáciami.
Stretnutie 30.9. 2026
Úlohy:
- Naučte sa Python, nainštalujte si Anaconda
- Zistite, čo sú multimodálne jazykové modely (napr. BLIP, LLaVA, FLAN-PaLM). Ako sa hodnotí kvalita multimodálnych výstupov? Napíšte krátku správu (2-3 strany) s relevantnými vedeckými článkami
- Oboznámte sa s existujúcimi multimodálnymi benchmarkmi (VQA, Visual Question Answering, Image Captioning)
- Oboznámte sa s knižnicou [Hugging Face Datasets](https://huggingface.co/docs/datasets) a metódami hodnotenia multimodálnych modelov. - Pozrite si záznam o práci https://zp.kemt.fei.tuke.sk/interns/dries_huybens
- Pozrite si zoznam existujúcich množín, poslaný cez Teams.
- Navrhnite svoju množinu - získanie z webu, digitalizácia nových dát alebo anotácia existujúcich dát.
Zásobník úloh:
- Otestujme rozpoznávanie rukopisov a matematických výrazov.