VeilEnglish

کارایی توکن‌ساز فارسی

هر مدل برای بیان یک معنای یکسان، در فارسی چند توکن خرج می‌کند و در انگلیسی چند توکن. اندازه‌گیری‌شده، نه تخمینی.

یک فارسی‌زبان برای همان ایده بین 1.14× تا 4.41× بیشتر از یک انگلیسی‌زبان هزینه می‌دهد؛ و اینکه کجای این بازه باشد، فقط به مدلی بستگی دارد که انتخاب می‌کند.

این صفحه چه چیزی را می‌سنجد

یک چیز مشخص و قطعی: تعداد توکن‌هایی که توکن‌ساز هر مدل برای رمزگذاری یک معنای یکسان در فارسی و در انگلیسی خرج می‌کند. این هم یک واقعیت هزینه‌ای است و هم یک واقعیت مربوط به پنجره متن. متن فارسی بر پایه توکن محاسبه می‌شود، پس توکن‌سازی که برای فارسی چهار برابر توکن خرج می‌کند، همان گفت‌وگو را چهار برابر گران‌تر و پنجره متن را چهار برابر زودتر پر می‌کند.

این صفحه چه چیزی را نمی‌سنجد

این معیار، کیفیت مدل، روانی فارسی، توان استدلال یا سودمندی را نمی‌سنجد. یک مدل می‌تواند فارسی را بهینه توکن کند و باز هم فارسی را بد بنویسد. عنوان این فهرست دقیقاً همان یک محوری است که سنجیده شده، چون رتبه‌بندی‌ای که بیش از آزموده‌اش ادعا کند، از نبود رتبه‌بندی بدتر است.

اندازه‌گیری در 2026-08-19. با انتشار هر مدل مهم، دوباره اجرا می‌شود.

هزینهٔ انگلیسیآنچه فارسی افزون بر آن می‌پردازد

کارایی توکن‌ساز فارسی، به ترتیب رتبه. عدد کمتر بهتر است.
رتبهمدلسازندههزینه فارسیتوکن فارسیتوکن انگلیسیاندازه واژگانفایل توکن‌ساز
1PersianMindمدل ویژه فارسیUniversity of Tehran1.14×83973741510universitytehran/PersianMind-v1.0
2 هم‌رتبهGemmaGoogle1.31×908692256000Xenova/gemma-tokenizer
2 هم‌رتبهGemma 2Google1.31×908692256000Xenova/gemma2-tokenizer
4Mistral Small 3Mistral AI1.37×955698131072mistralai/Mistral-Small-24B-Instruct-2501
5 هم‌رتبهLlama 3Meta1.39×959689128256Xenova/llama-3-tokenizer
5 هم‌رتبهLlama 3.1Meta1.39×959689128256Xenova/Meta-Llama-3.1-Tokenizer
7 هم‌رتبهGPT-4oOpenAI1.41×969689200000Xenova/gpt-4o
7 هم‌رتبهgpt-oss 20BOpenAI1.41×969689200019openai/gpt-oss-20b
9GLM-4.5Z.ai1.73×1191689151365zai-org/GLM-4.5
10DeepSeek-V3DeepSeek1.74×1203693128815deepseek-ai/DeepSeek-V3
11 هم‌رتبهQwen2.5Alibaba2.58×1777689151665Qwen/Qwen2.5-7B-Instruct
11 هم‌رتبهQwen3Alibaba2.58×1777689151669Qwen/Qwen3-8B
13 هم‌رتبهGPT-4 / GPT-3.5 TurboOpenAI3.22×2216689100263Xenova/gpt-4
13 هم‌رتبهPhi-4Microsoft3.22×2216689100352microsoft/phi-4
13 هم‌رتبهOLMo 2Allen Institute for AI3.22×2216689100278allenai/OLMo-2-1124-7B
16 هم‌رتبهMistral v3Mistral AI4.17×301872332768Xenova/mistral-tokenizer-v3
16 هم‌رتبهMaral 7Bمدل ویژه فارسیMaralGPT4.17×301872332000MaralGPT/Maral-7B-alpha-1
18ClaudeAnthropic4.37×305369865000Xenova/claude-tokenizer
19Grok-1xAI4.41×3054692131072Xenova/grok-1-tokenizer

مدل‌هایی که یک توکن‌ساز مشترک دارند

جدول ادغام این‌ها بایت‌به‌بایت یکسان است، پس یک اندازه‌گیری‌اند که زیر چند نام فهرست شده، نه چند نتیجه جداگانه.

چرا اندازه‌گیری این موضوع اهمیت دارد

فارسی در واژگان تقریباً همه توکن‌سازها کم‌نماینده است و هزینه این کم‌نمایندگی تماماً بر دوش فارسی‌زبانان می‌افتد: صورت‌حساب بالاتر، پنجره متن کوتاه‌تر و پاسخ کندتر برای همان اندیشه. تقریباً هیچ‌کس این عدد را منتشر نمی‌کند. عمومی کردن آن، هدف این صفحه است.

چرا می‌توان به این اعداد اعتماد کرد

  1. بازگشت‌پذیری. مدلی که دنباله توکن‌هایش دقیقاً به همان متن ورودی بازنگردد، از فهرست کنار گذاشته می‌شود، نه اینکه با یک توضیح گزارش شود. قطعه‌بندی‌ای که بازگشت‌پذیر نیست، اصلاً قطعه‌بندی آن متن نیست.

روش

هر متن از پیکره دوزبانه با فایل توکن‌ساز خود همان مدل رمزگذاری شده است؛ فایلی که دقیقاً از همان نسخه‌ای خوانده شده که شناسه‌اش در جدول آمده. شمارش‌ها دقیق‌اند. هیچ بخشی از این کار مدلی را فراخوانی نمی‌کند، پس بازتولید کل این فهرست هزینه‌ای ندارد و به وضعیت هیچ سرویس‌دهنده‌ای وابسته نیست.

پیکره

28 متن که برای همین کار نوشته شده‌اند؛ هرکدام یک متن فارسی با ترجمه وفادار انگلیسی، در گونه‌های مختلف از خبری و فنی تا حقوقی، محاوره‌ای و ادبی. هر دو سو اطلاعات یکسانی دارند، چون ترجمه واژه‌به‌واژه یک زبان را به دلایل دستوری طولانی‌تر می‌کند و نسبت را خراب می‌کند. همه متن‌ها اصل و تازه‌اند، پس هیچ مدلی نمی‌تواند آن‌ها را از یک آزمون عمومی به خاطر سپرده باشد.

خودتان بازتولید کنید

ابزار اندازه‌گیری، پیکره و نتایج، همه در مخزن هستند. این فرمان هر فایل توکن‌ساز را می‌گیرد، همه متن‌ها را دوباره می‌سنجد و جدول را بازنویسی می‌کند:

pnpm run bench:tokenizer

داده باز

خارج از فهرست

دریافت این توکن‌سازها نیازمند احراز هویت است. نامشان به‌جای حذف خاموش، اینجا آمده؛ چون فهرستی که نرسیدن خود را پنهان کند، ضعفش را نشان نمی‌دهد.