You need to agree to share your contact information to access this model

This repository is publicly accessible, but you have to accept the conditions to access its files and content.

Бұл репозиторийге қолжетімділік өтінім бойынша беріледі. Өзіңіз туралы және деректерді қалай қолданатыңыз туралы жазыңыз — өтінімді TilQazyna командасы қарайды. · Доступ к репозиторию выдаётся по заявке. Расскажите о себе и о том, как собираетесь использовать данные — заявку рассматривает команда TilQazyna. · Access to this repository is granted on request. Tell us who you are and how you plan to use the material; the TilQazyna team reviews each application.

Log in or Sign Up to review the conditions and access this model content.

Til-Tokenizer-128k

Қазақ тіліне бейімделген көптілді tokenizer · Многоязычный tokenizer с поддержкой казахской морфологии · Multilingual tokenizer with Kazakh morphology support

Қазақша · Русский · English


Қазақша

Til-Tokenizer-128k — қазақ, орыс және ағылшын тілдеріне, код пен математикаға арналған byte-level BPE tokenizer. Репозиторий көлемі — 12.7 МБ; сөздікке 131072 токен кіреді. Қазақша мәтінді морфема жіктері бойынша алдын ала бөлуге арналған модель де бірге берілген.

Құрылымы

ByteLevel әліпбиі мәтіндегі байттарды толық қамтып, сирек Unicode таңбаларын, emoji мен CJK мәтінін де қайта қалпына келтіреді. Pre-tokenizer цифрларды жеке токендерге бөледі және бос орындарды сақтайды. Морфемалық режим екі кезеңнен тұрады: QazCorpora BIO белгілерінде үйретілген BiLSTM сегменттеушісі мәтінге морфема шекарасын қояды, содан кейін BPE сол шекарадан өтпейтін токендер жасайды.

Сипаттама Мәні
Сөздік көлемі 131072 токен
Атомдар 115
Арнайы токендер 415
Кейінгі арнайы токендерге сақталған орын 384
Қазақша морфема шекарасының recall көрсеткіші 0.896
Қазақша морфема шекарасының precision көрсеткіші 0.85
Қазақша морфема шекарасының F1 көрсеткіші 0.87

Tokenizer шамамен 39 ГБ теңгерілген іріктемеде үйретілген. Үлестің 30%-ы қазақша мәтінге, 20%-ы ағылшын тіліне, 16%-ы орыс тіліне, 20%-ы кодқа, 6%-ы математикаға және 8%-ы агенттік деректерге бөлінген. Толық бағалау нәтижелері eval_full.json файлында, ал конфигурация meta.json файлында сақталған.

Файлдар және қолдану

tokenizer.json файлын tokenizers кітапханасы тікелей ашады. Төмендегі код gated репозиторийден файлдарды жүктеп, мәтінді кодтап, қайта декодтайды:

from huggingface_hub import snapshot_download
from tokenizers import Tokenizer

repo_dir = snapshot_download("TilQazyna/Til-Tokenizer-128k")
tok = Tokenizer.from_file(f"{repo_dir}/tokenizer.json")

encoded = tok.encode("Мектептегі оқушылар математиканы оқыды")
print(encoded.tokens)
print(tok.decode(encoded.ids))

Қазақша морфемалық режимге morpheme_segmenter.py, qazcorpora_model.py және morpho_lemma_suf.pth қажет. Сегменттеуші мәтінді өңдегеннен кейін нәтиже tokenizer.json арқылы токенделеді.

Қолжетімділік

Карточка мен файлдар тізімі баршаға көрінеді, ал файлдарды жүктеу үшін репозиторий бетіндегі «Request access» түймесі арқылы өтінім беру керек. Өтінімді TilQazyna командасы қарайды.

Байланысты репозиторийлер

Tokenizer Til-Corpus корпусымен байланысты. Морфемалық BPE сөздігіне арналған деректер Til-vocab-morphbpe-96k-kkrumix-v1 репозиторийінде жарияланған.


Русский

Til-Tokenizer-128k — byte-level BPE tokenizer для казахского, русского и английского языков, кода и математики. Репозиторий занимает 12.7 МБ, словарь содержит 131072 токена. В комплект входит модель предварительного деления казахского текста по границам морфем.

Устройство

Алфавит ByteLevel покрывает каждый байт: редкие символы Unicode, emoji и тексты CJK проходят кодирование с точным восстановлением. Pre-tokenizer разделяет цифры на отдельные токены и сохраняет пробелы. Морфемный режим работает в два этапа: BiLSTM-сегментатор, обученный на BIO-разметке QazCorpora, расставляет границы морфем, затем BPE строит токены внутри этих границ.

Характеристика Значение
Размер словаря 131072 токена
Атомы 115
Специальные токены 415
Зарезервированные позиции для будущих специальных токенов 384
Recall границ казахских морфем 0.896
Precision границ казахских морфем 0.85
F1 границ казахских морфем 0.87

Tokenizer обучен на сбалансированной выборке объёмом около 39 ГБ. На казахский текст приходится 30%, на английский — 20%, на русский — 16%, на код — 20%, на математику — 6%, на агентские данные — 8%. Полные результаты оценки лежат в eval_full.json, конфигурация — в meta.json.

Файлы и запуск

Библиотека tokenizers открывает tokenizer.json напрямую. Код скачивает файлы закрытого по заявке репозитория, кодирует строку и восстанавливает исходный текст:

from huggingface_hub import snapshot_download
from tokenizers import Tokenizer

repo_dir = snapshot_download("TilQazyna/Til-Tokenizer-128k")
tok = Tokenizer.from_file(f"{repo_dir}/tokenizer.json")

encoded = tok.encode("Мектептегі оқушылар математиканы оқыды")
print(encoded.tokens)
print(tok.decode(encoded.ids))

Для морфемного режима нужны morpheme_segmenter.py, qazcorpora_model.py и morpho_lemma_suf.pth. Сначала сегментатор обрабатывает казахский текст, после чего результат передаётся в tokenizer.json.

Доступ

Карточка и список файлов видны всем. Скачивание открывается после одобрения заявки: кнопка «Request access» находится на странице репозитория, решение принимает команда TilQazyna.

Связанные репозитории

Tokenizer связан с корпусом Til-Corpus. Данные для морфемного BPE-словаря опубликованы в Til-vocab-morphbpe-96k-kkrumix-v1.


English

Til-Tokenizer-128k is a byte-level BPE tokenizer for Kazakh, Russian, English, code, and mathematics. The repository occupies 12.7 MB, and the vocabulary contains 131072 tokens. It also ships with a model that segments Kazakh text at morpheme boundaries before tokenization.

Architecture

The ByteLevel alphabet covers every byte, allowing rare Unicode characters, emoji, and CJK text to round-trip exactly. The pre-tokenizer separates individual digits and preserves whitespace. Morpheme-aware processing has two stages: a BiLSTM segmenter trained on QazCorpora BIO tags inserts morpheme boundaries, and BPE then forms tokens without crossing those boundaries.

Characteristic Value
Vocabulary size 131072 tokens
Atoms 115
Special tokens 415
Slots reserved for future special tokens 384
Kazakh morpheme-boundary recall 0.896
Kazakh morpheme-boundary precision 0.85
Kazakh morpheme-boundary F1 0.87

The tokenizer was fitted on a balanced sample of about 39 GB. Kazakh accounts for 30% of the mix, English for 20%, Russian for 16%, code for 20%, mathematics for 6%, and agent data for 8%. Full evaluation results are stored in eval_full.json, while meta.json records the configuration.

Files and usage

The tokenizers library can load tokenizer.json directly. This example downloads the gated repository files, encodes a string, and reconstructs the input:

from huggingface_hub import snapshot_download
from tokenizers import Tokenizer

repo_dir = snapshot_download("TilQazyna/Til-Tokenizer-128k")
tok = Tokenizer.from_file(f"{repo_dir}/tokenizer.json")

encoded = tok.encode("Мектептегі оқушылар математиканы оқыды")
print(encoded.tokens)
print(tok.decode(encoded.ids))

Morpheme-aware mode uses morpheme_segmenter.py, qazcorpora_model.py, and morpho_lemma_suf.pth. The segmenter first processes Kazakh text, and its output is then passed to tokenizer.json.

Access

The model card and file list are public. File downloads require approval: submit the form through “Request access” on the repository page, and the TilQazyna team will review it.

Related repositories

The tokenizer is linked to the Til-Corpus corpus. Data for a morpheme-aware BPE vocabulary is available in Til-vocab-morphbpe-96k-kkrumix-v1.


Лицензия · License: MIT · TilQazyna

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Collection including TilQazyna/Til-Tokenizer-128k