完成了7M数据集tokenizer的训练

2024-03-06 04:57:43 +00:00
parent 04a4bddd97
commit a65de1154e
7 changed files with 44646 additions and 3 deletions
--- a/src/models/globals.py
+++ b/src/models/globals.py
@@ -16,7 +16,7 @@ MAX_WIDTH  = 1280
 TEXIFY_INPUT_DENSITY = 100

 # ocr模型的tokenizer中的词典数量
-VOCAB_SIZE = 10000
+VOCAB_SIZE = 15000

 # ocr模型是否固定输入图片的大小
 OCR_FIX_SIZE = True
--- a/src/models/tokenizer/roberta-tokenizer-7Mformulas/merges.txt
+++ b/src/models/tokenizer/roberta-tokenizer-7Mformulas/merges.txt
--- a/src/models/tokenizer/roberta-tokenizer-7Mformulas/special_tokens_map.json
+++ b/src/models/tokenizer/roberta-tokenizer-7Mformulas/special_tokens_map.json
@@ -0,0 +1,15 @@
+{
+  "bos_token": "<s>",
+  "cls_token": "<s>",
+  "eos_token": "</s>",
+  "mask_token": {
+    "content": "<mask>",
+    "lstrip": true,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "pad_token": "<pad>",
+  "sep_token": "</s>",
+  "unk_token": "<unk>"
+}
--- a/src/models/tokenizer/roberta-tokenizer-7Mformulas/tokenizer.json
+++ b/src/models/tokenizer/roberta-tokenizer-7Mformulas/tokenizer.json
--- a/src/models/tokenizer/roberta-tokenizer-7Mformulas/tokenizer_config.json
+++ b/src/models/tokenizer/roberta-tokenizer-7Mformulas/tokenizer_config.json
@@ -0,0 +1,57 @@
+{
+  "add_prefix_space": false,
+  "added_tokens_decoder": {
+    "0": {
+      "content": "<s>",
+      "lstrip": false,
+      "normalized": true,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "1": {
+      "content": "<pad>",
+      "lstrip": false,
+      "normalized": true,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "2": {
+      "content": "</s>",
+      "lstrip": false,
+      "normalized": true,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "3": {
+      "content": "<unk>",
+      "lstrip": false,
+      "normalized": true,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "4": {
+      "content": "<mask>",
+      "lstrip": true,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    }
+  },
+  "bos_token": "<s>",
+  "clean_up_tokenization_spaces": true,
+  "cls_token": "<s>",
+  "eos_token": "</s>",
+  "errors": "replace",
+  "mask_token": "<mask>",
+  "model_max_length": 1000000000000000019884624838656,
+  "pad_token": "<pad>",
+  "sep_token": "</s>",
+  "tokenizer_class": "RobertaTokenizer",
+  "trim_offsets": true,
+  "unk_token": "<unk>"
+}
--- a/src/models/tokenizer/roberta-tokenizer-7Mformulas/vocab.json
+++ b/src/models/tokenizer/roberta-tokenizer-7Mformulas/vocab.json
--- a/src/models/tokenizer/train/train.py
+++ b/src/models/tokenizer/train/train.py
@@ -4,8 +4,8 @@ from ...globals import VOCAB_SIZE


 if __name__ == '__main__':
-    tokenizer = TexTeller.get_tokenizer('/home/lhy/code/TeXify/src/models/tokenizer/roberta-tokenizer-raw')
+    tokenizer = TexTeller.get_tokenizer('/home/lhy/code/TexTeller/src/models/tokenizer/roberta-tokenizer-raw')
    dataset = load_dataset("/home/lhy/code/TexTeller/src/models/ocr_model/train/data/loader.py")['train']
    new_tokenizer = tokenizer.train_new_from_iterator(text_iterator=dataset['latex_formula'], vocab_size=VOCAB_SIZE)
-    new_tokenizer.save_pretrained('/home/lhy/code/TeXify/src/models/tokenizer/roberta-tokenizer-550Kformulas')
+    new_tokenizer.save_pretrained('/home/lhy/code/TexTeller/src/models/tokenizer/roberta-tokenizer-7Mformulas')
    pause = 1