54 lines
2.3 KiB
Markdown
54 lines
2.3 KiB
Markdown
---
|
|
title: Samuel Štucka
|
|
published: true
|
|
taxonomy:
|
|
category: [bp2027]
|
|
tag: [nlp,corpus,text-processing]
|
|
author: Daniel Hladek
|
|
---
|
|
|
|
|
|
rok začiatku štúdia: 2024
|
|
|
|
# Bakalársky projekt 2027
|
|
|
|
Tvorba a spracovanie korpusu novinových článkov
|
|
|
|
|
|
Predbežné úlohy:
|
|
|
|
- Naučte sa Python, nainštalujte si Anaconda
|
|
- Oboznámte sa s metódami získavania a extrakcie textu z HTML novinových článkov (napr. [Readability](https://github.com/buriy/python-readability), [Trafilatura](https://github.com/adbar/trafilatura))
|
|
- Pozrite si: wget je nástorj na sťahovanie celých webov alebo ich sekcií. Druhá možnosť je použiť vlastný agent pre sťahovanie.
|
|
- Na uloženie textových dát je dobré použiť kombináciu súborového systému a relačnej databázy (sqlite, postresql).
|
|
|
|
|
|
Možné ciele semestrálneho projektu:
|
|
|
|
- Pripraviť čistý korpus novinových článkov s metadata informáciami.
|
|
- Korpus by mal uchovať HTML aj obrázky z článkov (bez reklám a rozhrania). Mal by byť získaný "slušným" spôsobom. Mal by extrahovatť čo najviac metainformácií o článkoch - autor, zdroj, dátum vydania, sekcia, kľúčové slovíčka, nadpis, perex. Je dobré zachovať odkazy na obrázky. Ku obrázkom je dobré zachovať titulku, popis.
|
|
- Neskôr je možné aplikovať jayzkový model na zistenie alebo doplnenie ďalších metainformácií.
|
|
- Neskôr môžeme spracovať aj blogy a diskusné skupiny.
|
|
- Môžeme dáta využiť na zlepšenie alebo overenie jazykových modelov.
|
|
- Implementovať pipeline na extrakciu a normalizáciu textu z rôznych zdrojov.
|
|
|
|
Stretnutie 29.9. 2026
|
|
|
|
Úlohy:
|
|
|
|
- Učte sa Python, zistite ako prebieha trénovanie a dotrénovanie jazykových modelov. Napíšte krátku správu o tom ako sa trénuje jazykový model a ako sa dajú využiť kvalitné novinové dáta.
|
|
- Pozrite si predchádzajúce práce na tomto Wiki súvisiace s textovými a obrázkovými dátami.
|
|
- Vytypujte si vhodné zdroje dát - články z servra Pravda. Aké iné noviny sú vhodné?
|
|
- Pozrite si ako funguje Internet Archive a Wayback Machine.
|
|
- Navrhnite vhodnú SQL relačnú schému.
|
|
- skripty a konfiguračné súbory dávajte ne KEMT git repozitár.
|
|
- neskôr je možné využiť školský server na uloženie dát.
|
|
|
|
Zásobník úloh:
|
|
|
|
- stiahnuť a spracovať blogy.
|
|
|
|
|
|
|
|
|