From 5b689099ff9e16d975ddb1b720a38b751e7df083 Mon Sep 17 00:00:00 2001 From: dano Date: Tue, 29 Sep 2026 07:55:35 +0000 Subject: [PATCH] Update pages/students/2024/samuel_stucka/README.md --- pages/students/2024/samuel_stucka/README.md | 25 +++++++++++++++++++++ 1 file changed, 25 insertions(+) diff --git a/pages/students/2024/samuel_stucka/README.md b/pages/students/2024/samuel_stucka/README.md index 30da0b01..03f8dfad 100644 --- a/pages/students/2024/samuel_stucka/README.md +++ b/pages/students/2024/samuel_stucka/README.md @@ -19,8 +19,33 @@ Predbežné úlohy: - Naučte sa Python, nainštalujte si Anaconda - Oboznámte sa s metódami získavania a extrakcie textu z HTML novinových článkov (napr. [Readability](https://github.com/buriy/python-readability), [Trafilatura](https://github.com/adbar/trafilatura)) +- Pozrite si: wget je nástorj na sťahovanie celých webov alebo ich sekcií. Druhá možnosť je použiť vlastný agent pre sťahovanie. +- Na uloženie textových dát je dobré použiť kombináciu súborového systému a relačnej databázy (sqlite, postresql). + Možné ciele semestrálneho projektu: - Pripraviť čistý korpus novinových článkov s metadata informáciami. +- Korpus by mal uchovať HTML aj obrázky z článkov (bez reklám a rozhrania). Mal by byť získaný "slušným" spôsobom. Mal by extrahovatť čo najviac metainformácií o článkoch - autor, zdroj, dátum vydania, sekcia, kľúčové slovíčka, nadpis, perex. Je dobré zachovať odkazy na obrázky. Ku obrázkom je dobré zachovať titulku, popis. +- Neskôr je možné aplikovať jayzkový model na zistenie alebo doplnenie ďalších metainformácií. +- Neskôr môžeme spracovať aj blogy a diskusné skupiny. +- Môžeme dáta využiť na zlepšenie alebo overenie jazykových modelov. - Implementovať pipeline na extrakciu a normalizáciu textu z rôznych zdrojov. + +Stretnutie 29.9. 2026 + +Úlohy: + +- Učte sa Python, zistite ako prebieha trénovanie a dotrénovanie jazykových modelov. Napíšte krátku správu o tom ako sa trénuje jazykový model a ako sa dajú využiť kvalitné novinové dáta. +- Pozrite si predchádzajúce práce na tomto Wiki súvisiace s textovými a obrázkovými dátami. +- Vytypujte si vhodné zdroje dát - články z servra Pravda. Aké iné noviny sú vhodné? +- Pozrite si ako funguje Internet Archive a Wayback Machine. +- Navrhnite vhodnú SQL relačnú schému. + +Zásobník úloh: + +- stiahnuť a spracovať blogy. + + + +