Update pages/students/2024/samuel_stucka/README.md

This commit is contained in:
dano 2026-09-29 07:55:35 +00:00
parent c4b8882fa7
commit 5b689099ff

View File

@ -19,8 +19,33 @@ Predbežné úlohy:
- Naučte sa Python, nainštalujte si Anaconda
- Oboznámte sa s metódami získavania a extrakcie textu z HTML novinových článkov (napr. [Readability](https://github.com/buriy/python-readability), [Trafilatura](https://github.com/adbar/trafilatura))
- Pozrite si: wget je nástorj na sťahovanie celých webov alebo ich sekcií. Druhá možnosť je použiť vlastný agent pre sťahovanie.
- Na uloženie textových dát je dobré použiť kombináciu súborového systému a relačnej databázy (sqlite, postresql).
Možné ciele semestrálneho projektu:
- Pripraviť čistý korpus novinových článkov s metadata informáciami.
- Korpus by mal uchovať HTML aj obrázky z článkov (bez reklám a rozhrania). Mal by byť získaný "slušným" spôsobom. Mal by extrahovatť čo najviac metainformácií o článkoch - autor, zdroj, dátum vydania, sekcia, kľúčové slovíčka, nadpis, perex. Je dobré zachovať odkazy na obrázky. Ku obrázkom je dobré zachovať titulku, popis.
- Neskôr je možné aplikovať jayzkový model na zistenie alebo doplnenie ďalších metainformácií.
- Neskôr môžeme spracovať aj blogy a diskusné skupiny.
- Môžeme dáta využiť na zlepšenie alebo overenie jazykových modelov.
- Implementovať pipeline na extrakciu a normalizáciu textu z rôznych zdrojov.
Stretnutie 29.9. 2026
Úlohy:
- Učte sa Python, zistite ako prebieha trénovanie a dotrénovanie jazykových modelov. Napíšte krátku správu o tom ako sa trénuje jazykový model a ako sa dajú využiť kvalitné novinové dáta.
- Pozrite si predchádzajúce práce na tomto Wiki súvisiace s textovými a obrázkovými dátami.
- Vytypujte si vhodné zdroje dát - články z servra Pravda. Aké iné noviny sú vhodné?
- Pozrite si ako funguje Internet Archive a Wayback Machine.
- Navrhnite vhodnú SQL relačnú schému.
Zásobník úloh:
- stiahnuť a spracovať blogy.