VeilEnglish

سنجش توکن فارسی

87
40
2.17×
1.02
0.45
پنجرهٔ6 1متن3 1بیشینهٔ7 1تعداد5 1توکن‌هایی10 1است3 1که2 1یک2 1مدل3 1می‌تواند9 1در2 1یک2 1درخواست7 1در2 1نظر3 1بگیرد.6

این ابزار نشان می‌دهد یک متن فارسی چند token مصرف می‌کند و آن را با ترجمهٔ انگلیسی‌اش مقایسه می‌کند. چون فارسی در واژگان tokenizerها کم‌نماینده است، همان معنا معمولاً دو تا چهار برابر بیشتر token می‌گیرد — یعنی هزینهٔ بیشتر و رسیدن زودتر به سقف متن.

روش و محدودیت: این یک تخمین بر پایهٔ طول بایتیِ UTF-8 است، نه اجرای واقعیِ یک tokenizer. جدول ادغامِ یک tokenizer واقعی صدها هزار مدخل دارد و فرستادن آن به مرورگر مگابایت‌ها هزینه دارد. نسبتی که این ابزار نشان می‌دهد درست است؛ عددِ دقیقِ هر مدل کمی فرق می‌کند.