From 20bcf01be7b715fc2efd2e63b0fa7c015640f23d Mon Sep 17 00:00:00 2001 From: Jakub Date: Thu, 20 Aug 2026 22:59:57 +0200 Subject: [PATCH] update --- README.md | Bin 9634 -> 8568 bytes .../translate_dataset_to_slovak.py | 15 ++------------- 2 files changed, 2 insertions(+), 13 deletions(-) diff --git a/README.md b/README.md index de461b87b140800a55118e1a8a31de318a0c8f9f..61f3037450f6dc95e6ee24314d2839dbd2affebc 100644 GIT binary patch delta 12 TcmZ4F{ljU)4e8BH3JX{PC=~@o delta 626 zcmb7BO-lk%6g@5q$|S9+Q6x}ABFMt1O+jEK2qtLOItLqda&*d%K3vqUWt;a8+PN$G z1^t3HE!?zl8@LZ4=)BQBb`g(Z-o5wSbI!Z>ed{iH-|@#o2qAzh%BZ1>26R;M!ORI` z9VKi!G#oK5!Gwl0yP9VdK!x=NQ9YDJ+#Q}wd?UKDDq<5G;%!uM#;}KNM5vJzPG3;G z%qnVvy{3)N;+(w2U-cVR@uV21cy@6xtUP&rqN7d)_o>*VZV3hcO=J)oAgGz5PE<(b zs`qc?itwnaxb-S7I-` zrlwsH$f;N`_}9g-I>;~Xn_o*eJ8=PN#> zszs#=GmFf(SZz>A<8}gYIV|Snz6`skPPS7t#j9^DXmEErvl3C{t;(-vcS|2tqQc68 l*5@28x^LR-gUvVWp8t5)aY5!ho&ESPAj)Xz@!8)V`2-npgaZHo diff --git a/strojovy_preklad/translate_dataset_to_slovak.py b/strojovy_preklad/translate_dataset_to_slovak.py index 3587c85..f8851a2 100644 --- a/strojovy_preklad/translate_dataset_to_slovak.py +++ b/strojovy_preklad/translate_dataset_to_slovak.py @@ -6,10 +6,6 @@ from datasets import load_dataset from transformers import AutoTokenizer, AutoModelForSeq2SeqLM -# ----------------------------- -# Nastavenia -# ----------------------------- - DATASET_NAME = "tatsu-lab/alpaca" SPLIT = "train" @@ -41,10 +37,7 @@ def is_empty(value): def load_already_done(path): - """ - Ak skript spadne alebo ho zastavíš, vie pokračovať. - Načíta už preložené riadky. - """ + if not path.exists(): return [] @@ -58,10 +51,7 @@ def load_already_done(path): def translate_batch(texts, tokenizer, model, device): - """ - Preloží batch textov z angličtiny do slovenčiny. - Prázdne texty nechá prázdne. - """ + results = [""] * len(texts) non_empty_indices = [] @@ -108,7 +98,6 @@ def translate_batch(texts, tokenizer, model, device): return results -# Main def main(): print("Loading dataset...")