کارایی توکنساز فارسی
هر مدل برای بیان یک معنای یکسان، در فارسی چند توکن خرج میکند و در انگلیسی چند توکن. اندازهگیریشده، نه تخمینی.
فاصله میان بهترین و بدترین توکنساز این فهرست
یک فارسیزبان برای همان ایده بین 1.14× تا 4.41× بیشتر از یک انگلیسیزبان هزینه میدهد؛ و اینکه کجای این بازه باشد، فقط به مدلی بستگی دارد که انتخاب میکند.
این صفحه چه چیزی را میسنجد
یک چیز مشخص و قطعی: تعداد توکنهایی که توکنساز هر مدل برای رمزگذاری یک معنای یکسان در فارسی و در انگلیسی خرج میکند. این هم یک واقعیت هزینهای است و هم یک واقعیت مربوط به پنجره متن. متن فارسی بر پایه توکن محاسبه میشود، پس توکنسازی که برای فارسی چهار برابر توکن خرج میکند، همان گفتوگو را چهار برابر گرانتر و پنجره متن را چهار برابر زودتر پر میکند.
این صفحه چه چیزی را نمیسنجد
این معیار، کیفیت مدل، روانی فارسی، توان استدلال یا سودمندی را نمیسنجد. یک مدل میتواند فارسی را بهینه توکن کند و باز هم فارسی را بد بنویسد. عنوان این فهرست دقیقاً همان یک محوری است که سنجیده شده، چون رتبهبندیای که بیش از آزمودهاش ادعا کند، از نبود رتبهبندی بدتر است.
اندازهگیری در 2026-08-19. با انتشار هر مدل مهم، دوباره اجرا میشود.
هزینهٔ انگلیسیآنچه فارسی افزون بر آن میپردازد
| رتبه | مدل | سازنده | هزینه فارسی | توکن فارسی | توکن انگلیسی | اندازه واژگان | فایل توکنساز |
|---|---|---|---|---|---|---|---|
| 1 | PersianMindمدل ویژه فارسی | University of Tehran | 839 | 737 | 41510 | universitytehran/PersianMind-v1.0 | |
| 2 همرتبه | Gemma | 908 | 692 | 256000 | Xenova/gemma-tokenizer✻ | ||
| 2 همرتبه | Gemma 2 | 908 | 692 | 256000 | Xenova/gemma2-tokenizer✻ | ||
| 4 | Mistral Small 3 | Mistral AI | 955 | 698 | 131072 | mistralai/Mistral-Small-24B-Instruct-2501 | |
| 5 همرتبه | Llama 3 | Meta | 959 | 689 | 128256 | Xenova/llama-3-tokenizer✻ | |
| 5 همرتبه | Llama 3.1 | Meta | 959 | 689 | 128256 | Xenova/Meta-Llama-3.1-Tokenizer✻ | |
| 7 همرتبه | GPT-4o | OpenAI | 969 | 689 | 200000 | Xenova/gpt-4o✻ | |
| 7 همرتبه | gpt-oss 20B | OpenAI | 969 | 689 | 200019 | openai/gpt-oss-20b | |
| 9 | GLM-4.5 | Z.ai | 1191 | 689 | 151365 | zai-org/GLM-4.5 | |
| 10 | DeepSeek-V3 | DeepSeek | 1203 | 693 | 128815 | deepseek-ai/DeepSeek-V3 | |
| 11 همرتبه | Qwen2.5 | Alibaba | 1777 | 689 | 151665 | Qwen/Qwen2.5-7B-Instruct | |
| 11 همرتبه | Qwen3 | Alibaba | 1777 | 689 | 151669 | Qwen/Qwen3-8B | |
| 13 همرتبه | GPT-4 / GPT-3.5 Turbo | OpenAI | 2216 | 689 | 100263 | Xenova/gpt-4✻ | |
| 13 همرتبه | Phi-4 | Microsoft | 2216 | 689 | 100352 | microsoft/phi-4 | |
| 13 همرتبه | OLMo 2 | Allen Institute for AI | 2216 | 689 | 100278 | allenai/OLMo-2-1124-7B | |
| 16 همرتبه | Mistral v3 | Mistral AI | 3018 | 723 | 32768 | Xenova/mistral-tokenizer-v3✻ | |
| 16 همرتبه | Maral 7Bمدل ویژه فارسی | MaralGPT | 3018 | 723 | 32000 | MaralGPT/Maral-7B-alpha-1 | |
| 18 | Claude | Anthropic | 3053 | 698 | 65000 | Xenova/claude-tokenizer✻ | |
| 19 | Grok-1 | xAI | 3054 | 692 | 131072 | Xenova/grok-1-tokenizer✻ |
مدلهایی که یک توکنساز مشترک دارند
جدول ادغام اینها بایتبهبایت یکسان است، پس یک اندازهگیریاند که زیر چند نام فهرست شده، نه چند نتیجه جداگانه.
- Llama 3.1 — Llama 3
- Qwen3 — Qwen2.5
چرا اندازهگیری این موضوع اهمیت دارد
فارسی در واژگان تقریباً همه توکنسازها کمنماینده است و هزینه این کمنمایندگی تماماً بر دوش فارسیزبانان میافتد: صورتحساب بالاتر، پنجره متن کوتاهتر و پاسخ کندتر برای همان اندیشه. تقریباً هیچکس این عدد را منتشر نمیکند. عمومی کردن آن، هدف این صفحه است.
چرا میتوان به این اعداد اعتماد کرد
- بازگشتپذیری. مدلی که دنباله توکنهایش دقیقاً به همان متن ورودی بازنگردد، از فهرست کنار گذاشته میشود، نه اینکه با یک توضیح گزارش شود. قطعهبندیای که بازگشتپذیر نیست، اصلاً قطعهبندی آن متن نیست.
روش
هر متن از پیکره دوزبانه با فایل توکنساز خود همان مدل رمزگذاری شده است؛ فایلی که دقیقاً از همان نسخهای خوانده شده که شناسهاش در جدول آمده. شمارشها دقیقاند. هیچ بخشی از این کار مدلی را فراخوانی نمیکند، پس بازتولید کل این فهرست هزینهای ندارد و به وضعیت هیچ سرویسدهندهای وابسته نیست.
پیکره
28 متن که برای همین کار نوشته شدهاند؛ هرکدام یک متن فارسی با ترجمه وفادار انگلیسی، در گونههای مختلف از خبری و فنی تا حقوقی، محاورهای و ادبی. هر دو سو اطلاعات یکسانی دارند، چون ترجمه واژهبهواژه یک زبان را به دلایل دستوری طولانیتر میکند و نسبت را خراب میکند. همه متنها اصل و تازهاند، پس هیچ مدلی نمیتواند آنها را از یک آزمون عمومی به خاطر سپرده باشد.
خودتان بازتولید کنید
ابزار اندازهگیری، پیکره و نتایج، همه در مخزن هستند. این فرمان هر فایل توکنساز را میگیرد، همه متنها را دوباره میسنجد و جدول را بازنویسی میکند:
pnpm run bench:tokenizerداده باز
خارج از فهرست
دریافت این توکنسازها نیازمند احراز هویت است. نامشان بهجای حذف خاموش، اینجا آمده؛ چون فهرستی که نرسیدن خود را پنهان کند، ضعفش را نشان نمیدهد.
- google/gemma-3-4b-it
- CohereLabs/aya-expanse-8b
- PartAI/Dorna-Llama3-8B-Instruct
- utter-project/EuroLLM-9B