zpwiki/pages/students/2024/samuel_stucka/README.md

52 lines
2.1 KiB
Markdown

---
title: Samuel Štucka
published: true
taxonomy:
category: [bp2027]
tag: [nlp,corpus,text-processing]
author: Daniel Hladek
---
rok začiatku štúdia: 2024
# Bakalársky projekt 2027
Tvorba a spracovanie korpusu novinových článkov
Predbežné úlohy:
- Naučte sa Python, nainštalujte si Anaconda
- Oboznámte sa s metódami získavania a extrakcie textu z HTML novinových článkov (napr. [Readability](https://github.com/buriy/python-readability), [Trafilatura](https://github.com/adbar/trafilatura))
- Pozrite si: wget je nástorj na sťahovanie celých webov alebo ich sekcií. Druhá možnosť je použiť vlastný agent pre sťahovanie.
- Na uloženie textových dát je dobré použiť kombináciu súborového systému a relačnej databázy (sqlite, postresql).
Možné ciele semestrálneho projektu:
- Pripraviť čistý korpus novinových článkov s metadata informáciami.
- Korpus by mal uchovať HTML aj obrázky z článkov (bez reklám a rozhrania). Mal by byť získaný "slušným" spôsobom. Mal by extrahovatť čo najviac metainformácií o článkoch - autor, zdroj, dátum vydania, sekcia, kľúčové slovíčka, nadpis, perex. Je dobré zachovať odkazy na obrázky. Ku obrázkom je dobré zachovať titulku, popis.
- Neskôr je možné aplikovať jayzkový model na zistenie alebo doplnenie ďalších metainformácií.
- Neskôr môžeme spracovať aj blogy a diskusné skupiny.
- Môžeme dáta využiť na zlepšenie alebo overenie jazykových modelov.
- Implementovať pipeline na extrakciu a normalizáciu textu z rôznych zdrojov.
Stretnutie 29.9. 2026
Úlohy:
- Učte sa Python, zistite ako prebieha trénovanie a dotrénovanie jazykových modelov. Napíšte krátku správu o tom ako sa trénuje jazykový model a ako sa dajú využiť kvalitné novinové dáta.
- Pozrite si predchádzajúce práce na tomto Wiki súvisiace s textovými a obrázkovými dátami.
- Vytypujte si vhodné zdroje dát - články z servra Pravda. Aké iné noviny sú vhodné?
- Pozrite si ako funguje Internet Archive a Wayback Machine.
- Navrhnite vhodnú SQL relačnú schému.
Zásobník úloh:
- stiahnuť a spracovať blogy.