Update pages/students/2024/samuel_stucka/README.md
This commit is contained in:
parent
c4b8882fa7
commit
5b689099ff
@ -19,8 +19,33 @@ Predbežné úlohy:
|
|||||||
|
|
||||||
- Naučte sa Python, nainštalujte si Anaconda
|
- Naučte sa Python, nainštalujte si Anaconda
|
||||||
- Oboznámte sa s metódami získavania a extrakcie textu z HTML novinových článkov (napr. [Readability](https://github.com/buriy/python-readability), [Trafilatura](https://github.com/adbar/trafilatura))
|
- Oboznámte sa s metódami získavania a extrakcie textu z HTML novinových článkov (napr. [Readability](https://github.com/buriy/python-readability), [Trafilatura](https://github.com/adbar/trafilatura))
|
||||||
|
- Pozrite si: wget je nástorj na sťahovanie celých webov alebo ich sekcií. Druhá možnosť je použiť vlastný agent pre sťahovanie.
|
||||||
|
- Na uloženie textových dát je dobré použiť kombináciu súborového systému a relačnej databázy (sqlite, postresql).
|
||||||
|
|
||||||
|
|
||||||
Možné ciele semestrálneho projektu:
|
Možné ciele semestrálneho projektu:
|
||||||
|
|
||||||
- Pripraviť čistý korpus novinových článkov s metadata informáciami.
|
- Pripraviť čistý korpus novinových článkov s metadata informáciami.
|
||||||
|
- Korpus by mal uchovať HTML aj obrázky z článkov (bez reklám a rozhrania). Mal by byť získaný "slušným" spôsobom. Mal by extrahovatť čo najviac metainformácií o článkoch - autor, zdroj, dátum vydania, sekcia, kľúčové slovíčka, nadpis, perex. Je dobré zachovať odkazy na obrázky. Ku obrázkom je dobré zachovať titulku, popis.
|
||||||
|
- Neskôr je možné aplikovať jayzkový model na zistenie alebo doplnenie ďalších metainformácií.
|
||||||
|
- Neskôr môžeme spracovať aj blogy a diskusné skupiny.
|
||||||
|
- Môžeme dáta využiť na zlepšenie alebo overenie jazykových modelov.
|
||||||
- Implementovať pipeline na extrakciu a normalizáciu textu z rôznych zdrojov.
|
- Implementovať pipeline na extrakciu a normalizáciu textu z rôznych zdrojov.
|
||||||
|
|
||||||
|
Stretnutie 29.9. 2026
|
||||||
|
|
||||||
|
Úlohy:
|
||||||
|
|
||||||
|
- Učte sa Python, zistite ako prebieha trénovanie a dotrénovanie jazykových modelov. Napíšte krátku správu o tom ako sa trénuje jazykový model a ako sa dajú využiť kvalitné novinové dáta.
|
||||||
|
- Pozrite si predchádzajúce práce na tomto Wiki súvisiace s textovými a obrázkovými dátami.
|
||||||
|
- Vytypujte si vhodné zdroje dát - články z servra Pravda. Aké iné noviny sú vhodné?
|
||||||
|
- Pozrite si ako funguje Internet Archive a Wayback Machine.
|
||||||
|
- Navrhnite vhodnú SQL relačnú schému.
|
||||||
|
|
||||||
|
Zásobník úloh:
|
||||||
|
|
||||||
|
- stiahnuť a spracovať blogy.
|
||||||
|
|
||||||
|
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
Loading…
Reference in New Issue
Block a user