zpwiki/pages/students/2024/samuel_stucka/README.md

2.3 KiB

title published taxonomy
Samuel Štucka true
category tag author
bp2027
nlp
corpus
text-processing
Daniel Hladek

rok začiatku štúdia: 2024

Bakalársky projekt 2027

Tvorba a spracovanie korpusu novinových článkov

Predbežné úlohy:

  • Naučte sa Python, nainštalujte si Anaconda
  • Oboznámte sa s metódami získavania a extrakcie textu z HTML novinových článkov (napr. Readability, Trafilatura)
  • Pozrite si: wget je nástorj na sťahovanie celých webov alebo ich sekcií. Druhá možnosť je použiť vlastný agent pre sťahovanie.
  • Na uloženie textových dát je dobré použiť kombináciu súborového systému a relačnej databázy (sqlite, postresql).

Možné ciele semestrálneho projektu:

  • Pripraviť čistý korpus novinových článkov s metadata informáciami.
  • Korpus by mal uchovať HTML aj obrázky z článkov (bez reklám a rozhrania). Mal by byť získaný "slušným" spôsobom. Mal by extrahovatť čo najviac metainformácií o článkoch - autor, zdroj, dátum vydania, sekcia, kľúčové slovíčka, nadpis, perex. Je dobré zachovať odkazy na obrázky. Ku obrázkom je dobré zachovať titulku, popis.
  • Neskôr je možné aplikovať jayzkový model na zistenie alebo doplnenie ďalších metainformácií.
  • Neskôr môžeme spracovať aj blogy a diskusné skupiny.
  • Môžeme dáta využiť na zlepšenie alebo overenie jazykových modelov.
  • Implementovať pipeline na extrakciu a normalizáciu textu z rôznych zdrojov.

Stretnutie 29.9. 2026

Úlohy:

  • Učte sa Python, zistite ako prebieha trénovanie a dotrénovanie jazykových modelov. Napíšte krátku správu o tom ako sa trénuje jazykový model a ako sa dajú využiť kvalitné novinové dáta.
  • Pozrite si predchádzajúce práce na tomto Wiki súvisiace s textovými a obrázkovými dátami.
  • Vytypujte si vhodné zdroje dát - články z servra Pravda. Aké iné noviny sú vhodné?
  • Pozrite si ako funguje Internet Archive a Wayback Machine.
  • Navrhnite vhodnú SQL relačnú schému.
  • skripty a konfiguračné súbory dávajte ne KEMT git repozitár.
  • neskôr je možné využiť školský server na uloženie dát.

Zásobník úloh:

  • stiahnuť a spracovať blogy.