diff --git a/pages/AGENTS.md b/pages/AGENTS.md new file mode 100644 index 00000000..8a1b0367 --- /dev/null +++ b/pages/AGENTS.md @@ -0,0 +1,186 @@ +# Wiki Content Guide + +## Purpose + +This Grav wiki manages final theses, semester projects, and internships. Treat its pages as long-lived supervision records rather than polished articles: preserve factual history, make current work easy to find, and distinguish recorded facts from proposed work. + +The main content areas are: + +- `topics/`: support materials and general project summaries. +- `interns/`: intern profiles. +- `students//`: student profiles grouped by the year in which the student started studying. + +## General editing rules + +- Preserve the language already used by a page. Student profiles are usually in Slovak; intern profiles may be in English. Use the page's language for new headings and text. +- Preserve valid Grav YAML front matter between `---` delimiters. Do not rename existing taxonomy keys. +- Treat `taxonomy.author` as the supervisor, `taxonomy.tag` as project keywords, and `taxonomy.category` as project-type/year categories such as `bp2027`, `dp2027`, or `vp2026`. +- Use lowercase `first_last` profile directory names without diacritics. Keep the person's correct spelling and diacritics in the front-matter `title`. +- Do not invent names, dates, assignments, status updates, completed work, repository URLs, results, or citations. If required information is missing, leave an explicit placeholder or ask for it. +- Keep links descriptive. Every active student project should have a visible link to its Git repository. Do not mistake a linked dependency, article, dataset, or related project for the student's repository. +- Prefer focused edits. Do not reformat or reorganize a legacy profile unless the task requires it. +- Apply the canonical formats below to new profiles and substantial new project sections. When updating an existing section, follow its established style unless doing so would make the record ambiguous. + +## Finding and comparing projects + +When searching for a person or project, search across `students/`, `interns/`, and `topics/`, not only the newest cohort. Check: + +- profile names and project titles; +- front-matter categories, tags, and authors; +- assignment text, goals, meeting status, and task backlogs; +- Git repository links and links to related wiki topics. + +When identifying similar projects, explain the similarity using concrete evidence such as a shared task, domain, dataset, method, model, or evaluation approach. Separate direct predecessors from projects that are only thematically related. + +## Creating a student profile + +Create a profile at `students///README.md`. Use this baseline: + +```markdown +--- +title: Full Student Name +published: true +taxonomy: + category: [project_type_and_end_year] + tag: [keyword-one,keyword-two] + author: Supervisor Name +--- + +rok začiatku štúdia: YYYY + +# Project Type YYYY + +Názov: + +Project title + +Repozitár: + +- [Git repozitár](https://example.invalid/repository) + +Zadanie: + +1. First assignment point. +2. Second assignment point. +``` + +Replace all placeholders before publishing. The year in the project heading and taxonomy category is the project's expected ending year, not the study start year. Add every project represented on the profile to `taxonomy.category`. + +Common Slovak project/category names are: + +- `Bakalárska práca` / `bpYYYY` +- `Bakalársky projekt` / `bpYYYY` +- `Diplomová práca` / `dpYYYY` +- `Diplomový projekt` / `dpYYYY` +- `Vedecký projekt` / `vpYYYY` +- `Tímový projekt` / `tpYYYY` + +Follow an existing nearby profile when another established project type is needed. + +## Creating an intern profile + +Create a profile at `interns//README.md`. Intern pages normally use the language of supervision and this baseline: + +```markdown +--- +title: Full Intern Name +published: true +taxonomy: + category: [internship-program] + tag: [keyword-one,keyword-two] + author: Supervisor Name +--- + +Internship program and period + +Goal: + +- Primary goal + +Repository: + +- [Git repository](https://example.invalid/repository) + +Tasks: + +1. First task. +2. Second task. +``` + +Record the internship period instead of a student study-start year. Add results, reports, datasets, and model links when they become available. + +## Student project sections + +A student may have several semester or final projects in one profile. Each project section must make these items identifiable: + +- project type and ending year in the heading; +- project title; +- assignment or clearly marked preliminary assignment; +- Git repository link; +- goals or expected outputs when known; +- dated meeting records. + +Place the newest/current project first. Keep older project records because they provide context and make related work discoverable. + +Do not silently turn preliminary ideas into an approved assignment. Label tentative content with the page's existing terms, for example `Predbežné zadanie`, `Návrh`, `Možné ciele`, or `Nápady`. + +## Meeting records + +Add new meetings under the relevant project, newest first. Use the page's language. A Slovak record should normally look like: + +```markdown +Stretnutie DD.MM.YYYY + +Stav: + +- Work completed or current observed state. +- Important problem or result. + +Úlohy: + +- Concrete next action with an observable output. +- Another prioritized action. + +Zásobník úloh: + +- Lower-priority or possible future work. +``` + +An English intern record may use `Meeting`, `State`, `Tasks`, and `Future tasks`. Omit an empty optional backlog, but do not omit known status or assigned tasks. Preserve checkbox notation where a page already uses it; never mark a task complete without recorded evidence. + +## Writing assignments and proposing tasks + +Write project assignments as numbered, outcome-oriented points. A useful assignment normally progresses through: + +1. reviewing relevant methods and literature; +2. selecting or preparing data, tools, or an experimental setup; +3. implementing and evaluating the proposed solution; +4. identifying limitations and proposing improvements. + +Adapt that sequence to the actual project instead of copying generic wording unchanged. Keep the title, assignment, goals, tasks, and expected artifacts consistent. + +When proposing new tasks from a project status: + +- read the latest meeting and unresolved earlier tasks first; +- connect each proposal to a recorded problem, result, assignment point, or missing deliverable; +- prioritize the smallest verifiable next steps; +- include expected artifacts such as code, data, tables, experiment results, or written sections; +- reuse relevant methods or resources found in similar projects, with links; +- distinguish immediate tasks from optional ideas or backlog items; +- include updating the Git repository when code or data is produced, without requesting secrets or credentials. + +Do not claim that a proposed experiment will improve results. State what it is intended to test and how the result should be evaluated. + +## Review checklist + +Before finishing a content change, verify that: + +- front matter is valid YAML and retains `title`, `published`, and taxonomy data; +- the profile path and study-start year or internship period agree; +- every project heading and category uses the ending year; +- the person's name, supervisor, and keywords are present; +- each active student project has its title, assignment, and Git repository link; +- a new meeting has a date, status, and actionable tasks and is in newest-first order; +- proposed facts are not presented as recorded facts; +- internal and external links are syntactically valid; +- unrelated historical content and formatting were left intact. diff --git a/pages/students/2022/jakub_schwarc/README.md b/pages/students/2022/jakub_schwarc/README.md index 798422d9..0623e53b 100644 --- a/pages/students/2022/jakub_schwarc/README.md +++ b/pages/students/2022/jakub_schwarc/README.md @@ -10,6 +10,36 @@ taxonomy: rok začiatku štúdia: 2022 +# Diplomová práca 2027 + +Stretnutie 1.10.ľ2026 + +Stav: + +- vytvorený repozitár s konfiguráciami +- vyskúšaná AYA collection dataset - zbehlo 86 percent datasetu. Kolísala evaluácia. +- vyskúšaná lm-eval a Alpaca. +- Momentálne máme k dispozicii SlovakAlpaca a slovenskú časť AYA colections. +- porovnanie AYA a Alpaca dotrénovania. Alpaca vyzerá lepšie. +- prípravených 10 experimentov s eval a loss priebehom. +- výsledky sú na https://git.kemt.fei.tuke.sk/js886io/Diplomovka + +Úlohy: + +- Navrhnite scenár pre dotrénovanie jazykového modelu. Ake LORA spôsoby? Ako nastaviť lm factory? +- Pripravte experiment na optimalizáciu hyperparametrov. Najdôležitejší je LR. Na ostetné sa môžete spýtať AI. Tú istú kofiguráciu spúštate s roznym LR v "menšom" experimente a sledujete evall loss. Sledujte aj gradient pre identifikáciu "explosion". Porovnanie má zmysel iba v rámci tohot experimentu. +- Napíšte projekt na HPC Perun. +- Pripravte skript, ktorý zozbiera a pripravý trénovacie dáta, ktoré mame k dispozícii. Dáta rozdeľte na 3 časti. train, test, eval. Test a eval by mali byť tak, nastavené, aby vyhodnotenie na nich netrovalo príáliš dlho. Stačí iba jedna mnoižina ak sú dáta podobné. +- pripravte skript, ktorý vyhodnotí výsledný model. Na vyhodnotenie použite "eval" časť dát. +- napíšte poznámky do DP, kde opíšete metódy ktoré používate - Supervised Fine Tuning, modely ktoré používate, spôsob vyhodnotenie. + +Úlohy na neskôr: + +- zlepšite trénovacie dáta +- použite vyhodnotenie SK-bench. +- Použite iný multilinguálny model na dotrénovanie - napr. OLMO. + + # Diplomový projekt 2026 diff --git a/pages/students/2022/jan_ptak/README.md b/pages/students/2022/jan_ptak/README.md index be63bc4a..94475195 100644 --- a/pages/students/2022/jan_ptak/README.md +++ b/pages/students/2022/jan_ptak/README.md @@ -10,6 +10,47 @@ taxonomy: rok začiatku štúdia: 2022 +# Diplomová práca 2027 + + +Téma: + +Agent pre manažment záverečných prác + +Úlohy na semester: + +Agent by mal vedieť: +- získať aktuálne dáta z GITU, +- vedieť v nich vyhľadávať a zodpovedať otázky z vyhľadávania. +- vedieť vyhľadávať na CRZP záverečné práce. +- mal by fungovať cez openwebui rozhranie. +- Vytvorte komplenté nasadenie agenta pomocou DockerCompose. + +Úlohy do budúcnosti: + +- vyhodnotte vyhľadávanie - porovnajte RAG a GraphRAG +- Pripravte testovacei scenáre pre agenta a s ich pomocou vyhodnotte agenta. + + +Stretnutie 30.9.2026 + +Stav: + +- Funguje RAG systém, prepojenie s OpenWEBUI. Zatiaľ len pomocou agenta - treba zistiť implementačné detaily. +- Používa modely cez ui.tukekemt.xyz - Fast120 (Qwen3.5) a me5mini +- začíname pracovať na GraphRAG a Neo4J + +Úlohy: + +- Pokračujte v GraphRAG - Naprogramujte načítanie existujúcich Markdown textov do Neo4j — vytvorte uzly pre každú záverečnú prácu, autora, tému a kľúčové slová. Vytvorte grafové relácie medzi uzlami (napr. rovnaký autor → rovnaká téma, rovnaký študijný program) +- Napíšte poznámky o GraphRAG — definícia, ako funguje, rozdiel oproti klasickému RAG, výhody a nevýhody +- Agenta rozdeľte na samostatné komponenty (násttroje - tools alebo skills). Každý nástroj dajte do osobitného adresára na GIte. Každý nástroj by sa mal z gitu dať nainštalovať do OpenWebUI. +- Pridajte aj "hlavného agenta" - prompt, ktorý buyde pracovať s nástrojmi, +- Agenta, ktorý bude vyhľadávať na GITe môžete koncipovať ako MCP server, ktorý bude bežať v Dockeri. +- Obboznámte sa s pojmami MCP, Tool, Skill, AGENTS.md + + + # Diplomový projekt 2026 diff --git a/pages/students/2024/samuel_stucka/README.md b/pages/students/2024/samuel_stucka/README.md index 30da0b01..59d84b83 100644 --- a/pages/students/2024/samuel_stucka/README.md +++ b/pages/students/2024/samuel_stucka/README.md @@ -19,8 +19,35 @@ Predbežné úlohy: - Naučte sa Python, nainštalujte si Anaconda - Oboznámte sa s metódami získavania a extrakcie textu z HTML novinových článkov (napr. [Readability](https://github.com/buriy/python-readability), [Trafilatura](https://github.com/adbar/trafilatura)) +- Pozrite si: wget je nástorj na sťahovanie celých webov alebo ich sekcií. Druhá možnosť je použiť vlastný agent pre sťahovanie. +- Na uloženie textových dát je dobré použiť kombináciu súborového systému a relačnej databázy (sqlite, postresql). + Možné ciele semestrálneho projektu: - Pripraviť čistý korpus novinových článkov s metadata informáciami. +- Korpus by mal uchovať HTML aj obrázky z článkov (bez reklám a rozhrania). Mal by byť získaný "slušným" spôsobom. Mal by extrahovatť čo najviac metainformácií o článkoch - autor, zdroj, dátum vydania, sekcia, kľúčové slovíčka, nadpis, perex. Je dobré zachovať odkazy na obrázky. Ku obrázkom je dobré zachovať titulku, popis. +- Neskôr je možné aplikovať jayzkový model na zistenie alebo doplnenie ďalších metainformácií. +- Neskôr môžeme spracovať aj blogy a diskusné skupiny. +- Môžeme dáta využiť na zlepšenie alebo overenie jazykových modelov. - Implementovať pipeline na extrakciu a normalizáciu textu z rôznych zdrojov. + +Stretnutie 29.9. 2026 + +Úlohy: + +- Učte sa Python, zistite ako prebieha trénovanie a dotrénovanie jazykových modelov. Napíšte krátku správu o tom ako sa trénuje jazykový model a ako sa dajú využiť kvalitné novinové dáta. +- Pozrite si predchádzajúce práce na tomto Wiki súvisiace s textovými a obrázkovými dátami. +- Vytypujte si vhodné zdroje dát - články z servra Pravda. Aké iné noviny sú vhodné? +- Pozrite si ako funguje Internet Archive a Wayback Machine. +- Navrhnite vhodnú SQL relačnú schému. +- skripty a konfiguračné súbory dávajte ne KEMT git repozitár. +- neskôr je možné využiť školský server na uloženie dát. + +Zásobník úloh: + +- stiahnuť a spracovať blogy. + + + + diff --git a/pages/students/2024/sebastian_kiss/README.md b/pages/students/2024/sebastian_kiss/README.md index 2b48bff8..15bd9b61 100644 --- a/pages/students/2024/sebastian_kiss/README.md +++ b/pages/students/2024/sebastian_kiss/README.md @@ -14,14 +14,28 @@ rok začiatku štúdia: 2024 Dáta pre vyhodnotenie multimodálnych jazykových modelov -Úlohy: - -- Naučte sa Python, nainštalujte si Anaconda -- Oboznámte sa s knižnicou [Hugging Face Datasets](https://huggingface.co/docs/datasets) a metódami hodnotenia multimodálnych modelov. Zistite, čo sú multimodálne jazykové modely (napr. BLIP, LLaVA, FLAN-PaLM). Ako sa hodnotí kvalita multimodálnych výstupov? Napíšte krátku správu (2-3 strany) s relevantnými vedeckými článkami -- Oboznámte sa s existujúcimi multimodálnymi benchmarkmi (VQA, Visual Question Answering, Image Captioning) +Ciel: Vytvoriť a použiť novú dátovú množinu pre vyhodnotenie muliimodálnych modelov s podporou slovenského jazyka Možné ciele semestrálneho projektu: - Pripraviť nový evalučný dátový súbor pre multimodálne jazykové modely. - Vytvoriť benchmark na porovnanie kvality výstupov rôznych multimodálnych modelov. - Implementovať automatickú metriku na hodnotenie semantickej zhody medzi textovými a vizuálnymi reprezentáciami. + +Stretnutie 30.9. 2026 + + +Úlohy: + +- Naučte sa Python, nainštalujte si Anaconda +- Zistite, čo sú multimodálne jazykové modely (napr. BLIP, LLaVA, FLAN-PaLM). Ako sa hodnotí kvalita multimodálnych výstupov? Napíšte krátku správu (2-3 strany) s relevantnými vedeckými článkami +- Oboznámte sa s existujúcimi multimodálnymi benchmarkmi (VQA, Visual Question Answering, Image Captioning) +- Oboznámte sa s knižnicou [Hugging Face Datasets](https://huggingface.co/docs/datasets) a metódami hodnotenia multimodálnych modelov. - Pozrite si záznam o práci https://zp.kemt.fei.tuke.sk/interns/dries_huybens +- Pozrite si zoznam existujúcich množín, poslaný cez Teams. +- Navrhnite svoju množinu - získanie z webu, digitalizácia nových dát alebo anotácia existujúcich dát. + +Zásobník úloh: + +- Otestujme rozpoznávanie rukopisov a matematických výrazov. + +