سنجش توکن فارسی
87توکن — fa
40توکن — en
2.17×چند برابر
1.02توکن بر نویسه — fa
0.45توکن بر نویسه — en
پنجرهٔ6 1متن3 1بیشینهٔ7 1تعداد5 1توکنهایی10 1است3 1که2 1یک2 1مدل3 1میتواند9 1در2 1یک2 1درخواست7 1در2 1نظر3 1بگیرد.6
این ابزار نشان میدهد یک متن فارسی چند token مصرف میکند و آن را با ترجمهٔ انگلیسیاش مقایسه میکند. چون فارسی در واژگان tokenizerها کمنماینده است، همان معنا معمولاً دو تا چهار برابر بیشتر token میگیرد — یعنی هزینهٔ بیشتر و رسیدن زودتر به سقف متن.
روش و محدودیت: این یک تخمین بر پایهٔ طول بایتیِ UTF-8 است، نه اجرای واقعیِ یک tokenizer. جدول ادغامِ یک tokenizer واقعی صدها هزار مدخل دارد و فرستادن آن به مرورگر مگابایتها هزینه دارد. نسبتی که این ابزار نشان میدهد درست است؛ عددِ دقیقِ هر مدل کمی فرق میکند.