--- title: Samuel Štucka published: true taxonomy: category: [bp2027] tag: [nlp,corpus,text-processing] author: Daniel Hladek --- rok začiatku štúdia: 2024 # Bakalársky projekt 2027 Tvorba a spracovanie korpusu novinových článkov Predbežné úlohy: - Naučte sa Python, nainštalujte si Anaconda - Oboznámte sa s metódami získavania a extrakcie textu z HTML novinových článkov (napr. [Readability](https://github.com/buriy/python-readability), [Trafilatura](https://github.com/adbar/trafilatura)) - Pozrite si: wget je nástorj na sťahovanie celých webov alebo ich sekcií. Druhá možnosť je použiť vlastný agent pre sťahovanie. - Na uloženie textových dát je dobré použiť kombináciu súborového systému a relačnej databázy (sqlite, postresql). Možné ciele semestrálneho projektu: - Pripraviť čistý korpus novinových článkov s metadata informáciami. - Korpus by mal uchovať HTML aj obrázky z článkov (bez reklám a rozhrania). Mal by byť získaný "slušným" spôsobom. Mal by extrahovatť čo najviac metainformácií o článkoch - autor, zdroj, dátum vydania, sekcia, kľúčové slovíčka, nadpis, perex. Je dobré zachovať odkazy na obrázky. Ku obrázkom je dobré zachovať titulku, popis. - Neskôr je možné aplikovať jayzkový model na zistenie alebo doplnenie ďalších metainformácií. - Neskôr môžeme spracovať aj blogy a diskusné skupiny. - Môžeme dáta využiť na zlepšenie alebo overenie jazykových modelov. - Implementovať pipeline na extrakciu a normalizáciu textu z rôznych zdrojov. Stretnutie 29.9. 2026 Úlohy: - Učte sa Python, zistite ako prebieha trénovanie a dotrénovanie jazykových modelov. Napíšte krátku správu o tom ako sa trénuje jazykový model a ako sa dajú využiť kvalitné novinové dáta. - Pozrite si predchádzajúce práce na tomto Wiki súvisiace s textovými a obrázkovými dátami. - Vytypujte si vhodné zdroje dát - články z servra Pravda. Aké iné noviny sú vhodné? - Pozrite si ako funguje Internet Archive a Wayback Machine. - Navrhnite vhodnú SQL relačnú schému. - skripty a konfiguračné súbory dávajte ne KEMT git repozitár. - neskôr je možné využiť školský server na uloženie dát. Zásobník úloh: - stiahnuť a spracovať blogy.