From 45a4828511154a565f7ead6a63266a50b2ed1bc2 Mon Sep 17 00:00:00 2001 From: Daniel Hladek Date: Thu, 13 Aug 2026 14:10:07 +0200 Subject: [PATCH] zz --- pages/interns/dries_huybens/README.md | 2 +- 1 file changed, 1 insertion(+), 1 deletion(-) diff --git a/pages/interns/dries_huybens/README.md b/pages/interns/dries_huybens/README.md index d0449fd2ea..a3fde81557 100644 --- a/pages/interns/dries_huybens/README.md +++ b/pages/interns/dries_huybens/README.md @@ -42,7 +42,7 @@ Project tasks update: - Prepare a multilingual parallel corpus from OPUS data - Prepare dataset for visual language model evaluation from foto - Prepare dataset for visual language model evaluation from wikipedia. You can use https://huggingface.co/datasets/wikimedia/wit_base . -- Prepare corpus of text and image data from pravda.sk . +- Prepare corpus of text and image data from pravda.sk . For each subdomain, create - raw HTML data with images. Then create corpus of images plus descriptions, subtitles and tags. Then create corpus of extracted text. You can use docling , trafilatura for text extration. Or design your own parser. Give source codes to a git repository with documentation. Put data files to school server. Do not download too fast, so our IP does not reveive a ban. Outupus: