You need to agree to share your contact information to access this model
This repository is publicly accessible, but you have to accept the conditions to access its files and content.
Бұл репозиторийге қолжетімділік өтінім бойынша беріледі. Өзіңіз туралы және деректерді қалай қолданатыңыз туралы жазыңыз — өтінімді TilQazyna командасы қарайды. · Доступ к репозиторию выдаётся по заявке. Расскажите о себе и о том, как собираетесь использовать данные — заявку рассматривает команда TilQazyna. · Access to this repository is granted on request. Tell us who you are and how you plan to use the material; the TilQazyna team reviews each application.
Log in or Sign Up to review the conditions and access this model content.
Til-Tokenizer-128k
Қазақ тіліне бейімделген көптілді tokenizer · Многоязычный tokenizer с поддержкой казахской морфологии · Multilingual tokenizer with Kazakh morphology support
Қазақша
Til-Tokenizer-128k — қазақ, орыс және ағылшын тілдеріне, код пен математикаға арналған byte-level BPE tokenizer. Репозиторий көлемі — 12.7 МБ; сөздікке 131072 токен кіреді. Қазақша мәтінді морфема жіктері бойынша алдын ала бөлуге арналған модель де бірге берілген.
Құрылымы
ByteLevel әліпбиі мәтіндегі байттарды толық қамтып, сирек Unicode таңбаларын, emoji мен CJK мәтінін де қайта қалпына келтіреді. Pre-tokenizer цифрларды жеке токендерге бөледі және бос орындарды сақтайды. Морфемалық режим екі кезеңнен тұрады: QazCorpora BIO белгілерінде үйретілген BiLSTM сегменттеушісі мәтінге морфема шекарасын қояды, содан кейін BPE сол шекарадан өтпейтін токендер жасайды.
| Сипаттама | Мәні |
|---|---|
| Сөздік көлемі | 131072 токен |
| Атомдар | 115 |
| Арнайы токендер | 415 |
| Кейінгі арнайы токендерге сақталған орын | 384 |
| Қазақша морфема шекарасының recall көрсеткіші | 0.896 |
| Қазақша морфема шекарасының precision көрсеткіші | 0.85 |
| Қазақша морфема шекарасының F1 көрсеткіші | 0.87 |
Tokenizer шамамен 39 ГБ теңгерілген іріктемеде үйретілген. Үлестің 30%-ы қазақша мәтінге, 20%-ы ағылшын тіліне, 16%-ы орыс тіліне, 20%-ы кодқа, 6%-ы математикаға және 8%-ы агенттік деректерге бөлінген. Толық бағалау нәтижелері eval_full.json файлында, ал конфигурация meta.json файлында сақталған.
Файлдар және қолдану
tokenizer.json файлын tokenizers кітапханасы тікелей ашады. Төмендегі код gated репозиторийден файлдарды жүктеп, мәтінді кодтап, қайта декодтайды:
from huggingface_hub import snapshot_download
from tokenizers import Tokenizer
repo_dir = snapshot_download("TilQazyna/Til-Tokenizer-128k")
tok = Tokenizer.from_file(f"{repo_dir}/tokenizer.json")
encoded = tok.encode("Мектептегі оқушылар математиканы оқыды")
print(encoded.tokens)
print(tok.decode(encoded.ids))
Қазақша морфемалық режимге morpheme_segmenter.py, qazcorpora_model.py және morpho_lemma_suf.pth қажет. Сегменттеуші мәтінді өңдегеннен кейін нәтиже tokenizer.json арқылы токенделеді.
Қолжетімділік
Карточка мен файлдар тізімі баршаға көрінеді, ал файлдарды жүктеу үшін репозиторий бетіндегі «Request access» түймесі арқылы өтінім беру керек. Өтінімді TilQazyna командасы қарайды.
Байланысты репозиторийлер
Tokenizer Til-Corpus корпусымен байланысты. Морфемалық BPE сөздігіне арналған деректер Til-vocab-morphbpe-96k-kkrumix-v1 репозиторийінде жарияланған.
Русский
Til-Tokenizer-128k — byte-level BPE tokenizer для казахского, русского и английского языков, кода и математики. Репозиторий занимает 12.7 МБ, словарь содержит 131072 токена. В комплект входит модель предварительного деления казахского текста по границам морфем.
Устройство
Алфавит ByteLevel покрывает каждый байт: редкие символы Unicode, emoji и тексты CJK проходят кодирование с точным восстановлением. Pre-tokenizer разделяет цифры на отдельные токены и сохраняет пробелы. Морфемный режим работает в два этапа: BiLSTM-сегментатор, обученный на BIO-разметке QazCorpora, расставляет границы морфем, затем BPE строит токены внутри этих границ.
| Характеристика | Значение |
|---|---|
| Размер словаря | 131072 токена |
| Атомы | 115 |
| Специальные токены | 415 |
| Зарезервированные позиции для будущих специальных токенов | 384 |
| Recall границ казахских морфем | 0.896 |
| Precision границ казахских морфем | 0.85 |
| F1 границ казахских морфем | 0.87 |
Tokenizer обучен на сбалансированной выборке объёмом около 39 ГБ. На казахский текст приходится 30%, на английский — 20%, на русский — 16%, на код — 20%, на математику — 6%, на агентские данные — 8%. Полные результаты оценки лежат в eval_full.json, конфигурация — в meta.json.
Файлы и запуск
Библиотека tokenizers открывает tokenizer.json напрямую. Код скачивает файлы закрытого по заявке репозитория, кодирует строку и восстанавливает исходный текст:
from huggingface_hub import snapshot_download
from tokenizers import Tokenizer
repo_dir = snapshot_download("TilQazyna/Til-Tokenizer-128k")
tok = Tokenizer.from_file(f"{repo_dir}/tokenizer.json")
encoded = tok.encode("Мектептегі оқушылар математиканы оқыды")
print(encoded.tokens)
print(tok.decode(encoded.ids))
Для морфемного режима нужны morpheme_segmenter.py, qazcorpora_model.py и morpho_lemma_suf.pth. Сначала сегментатор обрабатывает казахский текст, после чего результат передаётся в tokenizer.json.
Доступ
Карточка и список файлов видны всем. Скачивание открывается после одобрения заявки: кнопка «Request access» находится на странице репозитория, решение принимает команда TilQazyna.
Связанные репозитории
Tokenizer связан с корпусом Til-Corpus. Данные для морфемного BPE-словаря опубликованы в Til-vocab-morphbpe-96k-kkrumix-v1.
English
Til-Tokenizer-128k is a byte-level BPE tokenizer for Kazakh, Russian, English, code, and mathematics. The repository occupies 12.7 MB, and the vocabulary contains 131072 tokens. It also ships with a model that segments Kazakh text at morpheme boundaries before tokenization.
Architecture
The ByteLevel alphabet covers every byte, allowing rare Unicode characters, emoji, and CJK text to round-trip exactly. The pre-tokenizer separates individual digits and preserves whitespace. Morpheme-aware processing has two stages: a BiLSTM segmenter trained on QazCorpora BIO tags inserts morpheme boundaries, and BPE then forms tokens without crossing those boundaries.
| Characteristic | Value |
|---|---|
| Vocabulary size | 131072 tokens |
| Atoms | 115 |
| Special tokens | 415 |
| Slots reserved for future special tokens | 384 |
| Kazakh morpheme-boundary recall | 0.896 |
| Kazakh morpheme-boundary precision | 0.85 |
| Kazakh morpheme-boundary F1 | 0.87 |
The tokenizer was fitted on a balanced sample of about 39 GB. Kazakh accounts for 30% of the mix, English for 20%, Russian for 16%, code for 20%, mathematics for 6%, and agent data for 8%. Full evaluation results are stored in eval_full.json, while meta.json records the configuration.
Files and usage
The tokenizers library can load tokenizer.json directly. This example downloads the gated repository files, encodes a string, and reconstructs the input:
from huggingface_hub import snapshot_download
from tokenizers import Tokenizer
repo_dir = snapshot_download("TilQazyna/Til-Tokenizer-128k")
tok = Tokenizer.from_file(f"{repo_dir}/tokenizer.json")
encoded = tok.encode("Мектептегі оқушылар математиканы оқыды")
print(encoded.tokens)
print(tok.decode(encoded.ids))
Morpheme-aware mode uses morpheme_segmenter.py, qazcorpora_model.py, and morpho_lemma_suf.pth. The segmenter first processes Kazakh text, and its output is then passed to tokenizer.json.
Access
The model card and file list are public. File downloads require approval: submit the form through “Request access” on the repository page, and the TilQazyna team will review it.
Related repositories
The tokenizer is linked to the Til-Corpus corpus. Data for a morpheme-aware BPE vocabulary is available in Til-vocab-morphbpe-96k-kkrumix-v1.
Лицензия · License: MIT · TilQazyna