دادهها چی نشون میدن
سه عدد که به سوال جواب میدن. منبع: قیمتگذاری دستاول و Artificial Analysis Intelligence Index v4.1.
مردم چی میگن
یک نظر پرطرفدار از یک صدای معتبر این فضا ادعا میکنه GLM-5.2 در سطح تلاش استدلال متوسط از فرانتیر اختصاصی گرونتره. ارزش بررسی داره.
میدونم خیلیها راجع به GLM-5.2 هیجانزدهان. بهحق هم هست! اینکه یک مدل وزن باز از GPT-5.4 و همه مدلهای Gemini جلو بزنه فوقالعادهست. با این حال، ارزون نیست. هم Opus 4.8 و هم GPT-5.5 با سطح تلاش متوسط، از GLM-5.2 هم ارزونترن هم باهوشترTheo
تئو درباره نیمه اول حرفش درسته. GLM-5.2 واقعاً در Intelligence Index از GPT-5.4 و همه مدلهای Gemini جلوتره. اما نیمه دوم — بخش ارزونتر و باهوشتر — وقتی حسابوکتاب میکنی به هم میریزه.
دادههای قیمتگذاری
پارامترهای سطح تلاش استدلال کنترل میکنن مدل چند توکن صرف فکر کردن میکنه. نرخ هر توکن رو تغییر نمیدن.
پارامتر reasoning_effort در GPT-5.5، بودجه extended-thinking در Claude و reasoning_effort در GLM-5.2 همگی یک کار میکنن: کنترل میکنن مدل چند توکن صرف فکر کردن میکنه. نرخ هر توکن بدون توجه به حالت تلاش ثابت میمونه.
| مدل | ارائهدهنده | ورودی /MTok | هیت کش /MTok | خروجی /MTok |
|---|---|---|---|---|
| GLM-5.2 | Z.ai | $۱.۴۰ | $۰.۲۶ | $۴.۴۰ |
| Gemini 3 Pro | $۲.۰۰ | $۰.۲۰ | $۱۲.۰۰ | |
| Claude Opus 4.8 | Anthropic | $۵.۰۰ | $۰.۵۰ | $۲۵.۰۰ |
| GPT-5.5 | OpenAI | $۵.۰۰ | $۰.۵۰ | $۳۰.۰۰ |
برای اینکه Opus 4.8 در سطح تلاش متوسط از GLM-5.2 ارزونتر دربیاد، باید تقریباً ۵٫۷ برابر توکن استدلال کمتری نسبت به GLM-5.2 تولید کنه — به اندازهای که فاصله هر توکن رو ببنده. در عمل، GLM-5.2 در سطح تلاش متوسط توکن استدلال بیشتری نسبت به Opus 4.8 مصرف میکنه. فاصله نرخ هر توکن به اندازه کافی بزرگه که GLM-5.2 همچنان برنده باشه.
هزینه در یک بار کاری واقعی با استدلال متوسط
۲۰K توکن ورودی، ۷۰٪ هیت کش پرامپت، ۵K خروجی شامل استدلال. توکنهای استدلال در همه ارائهدهندهها به عنوان خروجی صورتحساب میشن.
هزینه به ازای هر درخواست
از ارزونترین مرتب شده. طول نوار هزینهست. شدت رنگ نشون میده هر مدل کجا قرار میگیره.
باهوشتر؟ نه. همترازن.
Artificial Analysis Intelligence Index v4.1، یک ترکیب وزنی از ۹ ارزیابی شامل GDPval-AA v2، Terminal-Bench v2.1، HLE، GPQA Diamond و AA-Omniscience.
AA Intelligence Index v4.1
چهار مدل فرانتیر در فاصله دو امتیازی همدیگه قرار گرفتن. فقط Claude Fable 5 با قیمت ۱۰ و ۵۰ دلار به ازای هر MTok، واضح جلوتره.
GLM-5.2 با امتیاز ۵۱ مدل پیشروی وزن باز در این شاخصه. بهطور خاص در GDPval-AA v2 — بنچمارک کار ایجنتیک دنیای واقعی — GLM-5.2 امتیاز ۱۵۲۴ میگیره و از GPT-5.5 (xhigh) با ۱۵۱۴ جلوتره. صدرنشینی شاخص هوش متعلق به Claude Fable 5 (~۶۰)ه که ۲ تا ۳ برابر بقیه چیزهای این نمودار هزینه داره.
تله: توکنهای خروجی بیشتر
تئو با یک نکته منصفانه دنبالش کرد. ارزونتر بودن هر توکن به معنای ارزونتر بودن در زمان نیست.
همچنین خیلی توکن خروجی بیشتری مصرف میکنه. خود توکنها ارزونترن، اما حجمشون یعنی زمان خیلی بیشتری برای انتظار نتایج صرف میکنی. بازم فوقالعادهست! فقط میخوام مطمئن بشم آدمها انتظاراتشون رو درست تنظیم میکننTheo
تئو در دنبالهاش اضافه کرد: حجمشون یعنی زمان خیلی بیشتری برای انتظار نتایج صرف میکنی. این درسته و ارزش این رو داره که صریح باشیم.
توکنهای خروجی به ازای هر کار
GLM-5.2 بیشترین توکن خروجی رو بین مدلهای پیشروی وزن باز تولید میکنه. هزینه هر توکن پایینتره، اما توکنهای بیشتری برای انتظار داری.
در حداکثر سطح تلاش فکر کردن، GLM-5.2 به ازای هر کار شاخص هوش ۴۳هزار توکن خروجی تولید میکنه (۳۷هزار استدلال، ۶هزار پاسخ). برای مقایسه، MiniMax-M3 ۲۴هزار، Kimi K2.6 ۳۵هزار و DeepSeek V4 Pro (max) ۳۷هزار توکن تولید میکنن. GLM-5.2 تقریباً ۶۵٪ تا ۸۰٪ پرگویتر از سبکترین همتایان وزن بازشه.
برای کارهای batch و پایپلاینهای شبانه این بیمعنیه؛ مزیت هزینه غالب میشه. برای استفاده تعاملی حساس به تأخیر، Opus 4.8 یا GPT-5.5 با سطح تلاش متوسط چابکتر به نظر میرسن، حتی با هزینه بالاتر، چون با توکن کمتری فکر کردنشون رو تموم میکنن. این یک معاوضه واقعیه، نه یک پاورقی.
کجا ادعا میتونه به لحاظ فنی درست باشه
سه مورد محدود که توش Opus 4.8 متوسط میتونه از نظر هزینه از GLM-5.2 متوسط جلو بزنه، اگه چشمت رو نیمهبسته کنی.
دادهها چی میگن
سه جمعبندی. هزینه، هوش، دسترسی. دادهها روی هر سه صادقه.
GLM-5.2 در همه سطحهای منتشرشده تلاش استدلال از Opus 4.8 و GPT-5.5 ارزونتره. در Artificial Analysis Intelligence Index v4.1 تقریباً با هر دو همترازه. از Z.ai با مجوز MIT میاد، یعنی خودمیزبانی، فاینتیونینگ و نبود هیچ وابستگی به فروشنده، گزینههای واقعیان. هیچکدوم از مدلهای فرانتیر اختصاصی همچین چیزی ارائه نمیدن.
برای اولین بار، یک مدل وزن باز در هزینه، هوش و دسترسی، رقیب رودرروی فرانتیره. این چیز درستی برای سازندههایییه که نمیخوان به یک ارائهدهنده واحد وابسته باشن. هایپ درسته. روی تأخیر انتظارات رو تنظیم کن، بعد منتشر کن.
منابع
هر ادعای این صفحه به یک منبع دستاول برمیگرده. هیچ عدد ساختگیای وجود نداره.
آخرین بهروزرسانی: ۲۱ ژوئن ۲۰۲۶. قیمتها در همین تاریخ از صفحههای قیمتگذاری دستاول گرفته شدن. Intelligence Index v4.1 در ۱۵ ژوئن ۲۰۲۶ منتشر شده.
وزن باز. هوش واقعی. مزیت هزینه واقعی.
GLM-5.2 در همه سطحهای تلاش استدلال از Opus 4.8 و GPT-5.5 ارزونتره. در شاخص هوش با هر دو همترازه. مجوز MIT. خودمیزبانی، فاینتیونینگ، بدون وابستگی به فروشنده. فرانتیر بازه.
مخزن SpielOS رو کلون کن