# Token size in Russian lang

**URL:** <https://community.openai.com/t/token-size-in-russian-lang/30767>\
**Category:** API\
**Created:** [January 6, 2023, 10:07am UTC](https://community.openai.com/t/token-size-in-russian-lang/30767 "2023-01-06T10:07:11Z")\
**Posts on this page:** 4\
**Page:** 1

<div class="post-metadata">

**Author:** ![msveshnikov](https://sea2.discourse-cdn.com/openai1/user_avatar/community.openai.com/msveshnikov/32/16902_2.png) [@msveshnikov](https://community.openai.com/u/msveshnikov)\
**Post date:** [January 6, 2023, 10:07am UTC](https://community.openai.com/t/token-size-in-russian-lang/30767/1 "2023-01-06T10:07:11Z")

</div>

Hello, I found that for Russian text each letter is a token. At least I ingest this from my pricing bill. Is it correct? Not 0.75 word == token, like in English, but 1 russian letter == token?

---

<div class="post-metadata">

**Author:** ![PaulBellow](https://sea2.discourse-cdn.com/openai1/user_avatar/community.openai.com/paulbellow/32/597962_2.png) [@PaulBellow](https://community.openai.com/u/PaulBellow)\
**Post date:** [January 6, 2023, 5:36pm UTC](https://community.openai.com/t/token-size-in-russian-lang/30767/2 "2023-01-06T17:36:01Z")

</div>

Here’s a tokenizer where you can test…

> **[OpenAI API](https://beta.openai.com/tokenizer?view=bpe)**
>
> An API for accessing new AI models developed by OpenAI

Welcome to the community!

---

<div class="post-metadata">

**Author:** ![msveshnikov](https://sea2.discourse-cdn.com/openai1/user_avatar/community.openai.com/msveshnikov/32/16902_2.png) [@msveshnikov](https://community.openai.com/u/msveshnikov)\
**Post date:** [January 6, 2023, 6:02pm UTC](https://community.openai.com/t/token-size-in-russian-lang/30767/3 "2023-01-06T18:02:12Z")

</div>

Yes, thank you! Tested, 1 russian letter is 1 token indeed. What a discrimination 🙂

---

<div class="post-metadata">

**Author:** ![mike\_orlov](https://sea2.discourse-cdn.com/openai1/user_avatar/community.openai.com/mike_orlov/32/146310_2.png) [@mike\_orlov](https://community.openai.com/u/mike_orlov)\
**Post date:** [July 18, 2024, 2:26pm UTC](https://community.openai.com/t/token-size-in-russian-lang/30767/4 "2024-07-18T14:26:48Z")

</div>

Indeed, it is. The reason is language features like many prefixes and endings, word declensions etc. But it looks like the ratio has become better, since the original post.

Funny fact: every hieroglyph would be a token in Korean or Chinese.
