داده‌ها چی نشون می‌دن

سه عدد که به سوال جواب می‌دن. منبع: قیمت‌گذاری دست‌اول و Artificial Analysis Intelligence Index v4.1.

۵.۶×

در برابر GPT-5.5

ارزون‌تر به ازای هر درخواست در سطح تلاش استدلال متوسط

۵.۱×

در برابر Claude Opus 4.8

ارزون‌تر به ازای هر درخواست در سطح تلاش استدلال متوسط

۵۱

AA Intelligence Index

مدل پیشروی وزن باز، هم‌تراز با Opus 4.8 و GPT-5.5


مردم چی می‌گن

یک نظر پرطرفدار از یک صدای معتبر این فضا ادعا می‌کنه GLM-5.2 در سطح تلاش استدلال متوسط از فرانتیر اختصاصی گرون‌تره. ارزش بررسی داره.

می‌دونم خیلی‌ها راجع به GLM-5.2 هیجان‌زده‌ان. به‌حق هم هست! اینکه یک مدل وزن باز از GPT-5.4 و همه مدل‌های Gemini جلو بزنه فوق‌العاده‌ست. با این حال، ارزون نیست. هم Opus 4.8 و هم GPT-5.5 با سطح تلاش متوسط، از GLM-5.2 هم ارزون‌ترن هم باهوش‌تر
Theo

تئو درباره نیمه اول حرفش درسته. GLM-5.2 واقعاً در Intelligence Index از GPT-5.4 و همه مدل‌های Gemini جلوتره. اما نیمه دوم — بخش ارزون‌تر و باهوش‌تر — وقتی حسابوکتاب می‌کنی به هم می‌ریزه.


داده‌های قیمت‌گذاری

پارامترهای سطح تلاش استدلال کنترل می‌کنن مدل چند توکن صرف فکر کردن می‌کنه. نرخ هر توکن رو تغییر نمی‌دن.

پارامتر reasoning_effort در GPT-5.5، بودجه extended-thinking در Claude و reasoning_effort در GLM-5.2 همگی یک کار می‌کنن: کنترل می‌کنن مدل چند توکن صرف فکر کردن می‌کنه. نرخ هر توکن بدون توجه به حالت تلاش ثابت می‌مونه.

مدلارائه‌دهندهورودی /MTokهیت کش /MTokخروجی /MTok
GLM-5.2Z.ai$۱.۴۰$۰.۲۶$۴.۴۰
Gemini 3 ProGoogle$۲.۰۰$۰.۲۰$۱۲.۰۰
Claude Opus 4.8Anthropic$۵.۰۰$۰.۵۰$۲۵.۰۰
GPT-5.5OpenAI$۵.۰۰$۰.۵۰$۳۰.۰۰

برای اینکه Opus 4.8 در سطح تلاش متوسط از GLM-5.2 ارزون‌تر دربیاد، باید تقریباً ۵٫۷ برابر توکن استدلال کمتری نسبت به GLM-5.2 تولید کنه — به اندازه‌ای که فاصله هر توکن رو ببنده. در عمل، GLM-5.2 در سطح تلاش متوسط توکن استدلال بیشتری نسبت به Opus 4.8 مصرف می‌کنه. فاصله نرخ هر توکن به اندازه کافی بزرگه که GLM-5.2 همچنان برنده باشه.


هزینه در یک بار کاری واقعی با استدلال متوسط

۲۰K توکن ورودی، ۷۰٪ هیت کش پرامپت، ۵K خروجی شامل استدلال. توکن‌های استدلال در همه ارائه‌دهنده‌ها به عنوان خروجی صورتحساب می‌شن.

هزینه به ازای هر درخواست

از ارزون‌ترین مرتب شده. طول نوار هزینه‌ست. شدت رنگ نشون می‌ده هر مدل کجا قرار می‌گیره.

Opus 4.8 → GLM-5.2
$۰.۲۹ → $۰.۰۶
در همین بار کاری ۵٫۱ برابر گرون‌تره.
GPT-5.5 → GLM-5.2
$۰.۳۴ → $۰.۰۶
در همین بار کاری ۶٫۰ برابر گرون‌تره.
Gemini 3 Pro → GLM-5.2
$۰.۱۳ → $۰.۰۶
در همین بار کاری ۲٫۴ برابر گرون‌تره.

باهوش‌تر؟ نه. هم‌ترازن.

Artificial Analysis Intelligence Index v4.1، یک ترکیب وزنی از ۹ ارزیابی شامل GDPval-AA v2، Terminal-Bench v2.1، HLE، GPQA Diamond و AA-Omniscience.

AA Intelligence Index v4.1

چهار مدل فرانتیر در فاصله دو امتیازی هم‌دیگه قرار گرفتن. فقط Claude Fable 5 با قیمت ۱۰ و ۵۰ دلار به ازای هر MTok، واضح جلوتره.

GLM-5.2 با امتیاز ۵۱ مدل پیشروی وزن باز در این شاخصه. به‌طور خاص در GDPval-AA v2 — بنچمارک کار ایجنتیک دنیای واقعی — GLM-5.2 امتیاز ۱۵۲۴ می‌گیره و از GPT-5.5 (xhigh) با ۱۵۱۴ جلوتره. صدرنشینی شاخص هوش متعلق به Claude Fable 5 (~۶۰)ه که ۲ تا ۳ برابر بقیه چیزهای این نمودار هزینه داره.


تله: توکن‌های خروجی بیشتر

تئو با یک نکته منصفانه دنبالش کرد. ارزون‌تر بودن هر توکن به معنای ارزون‌تر بودن در زمان نیست.

همچنین خیلی توکن خروجی بیشتری مصرف می‌کنه. خود توکن‌ها ارزون‌ترن، اما حجمشون یعنی زمان خیلی بیشتری برای انتظار نتایج صرف می‌کنی. بازم فوق‌العاده‌ست! فقط می‌خوام مطمئن بشم آدم‌ها انتظاراتشون رو درست تنظیم می‌کنن
Theo

تئو در دنباله‌اش اضافه کرد: حجمشون یعنی زمان خیلی بیشتری برای انتظار نتایج صرف می‌کنی. این درسته و ارزش این رو داره که صریح باشیم.

توکن‌های خروجی به ازای هر کار

GLM-5.2 بیشترین توکن خروجی رو بین مدل‌های پیشروی وزن باز تولید می‌کنه. هزینه هر توکن پایین‌تره، اما توکن‌های بیشتری برای انتظار داری.

در حداکثر سطح تلاش فکر کردن، GLM-5.2 به ازای هر کار شاخص هوش ۴۳هزار توکن خروجی تولید می‌کنه (۳۷هزار استدلال، ۶هزار پاسخ). برای مقایسه، MiniMax-M3 ۲۴هزار، Kimi K2.6 ۳۵هزار و DeepSeek V4 Pro (max) ۳۷هزار توکن تولید می‌کنن. GLM-5.2 تقریباً ۶۵٪ تا ۸۰٪ پرگوی‌تر از سبک‌ترین همتایان وزن بازشه.

برای کارهای batch و پایپلاین‌های شبانه این بی‌معنیه؛ مزیت هزینه غالب می‌شه. برای استفاده تعاملی حساس به تأخیر، Opus 4.8 یا GPT-5.5 با سطح تلاش متوسط چابک‌تر به نظر می‌رسن، حتی با هزینه بالاتر، چون با توکن کمتری فکر کردنشون رو تموم می‌کنن. این یک معاوضه واقعیه، نه یک پاورقی.


کجا ادعا می‌تونه به لحاظ فنی درست باشه

سه مورد محدود که توش Opus 4.8 متوسط می‌تونه از نظر هزینه از GLM-5.2 متوسط جلو بزنه، اگه چشمت رو نیمه‌بسته کنی.

مورد محدود ۱

Batch API

Anthropic و OpenAI برای کارهای batch پنجاه‌درصد تخفیف می‌دن. Z.ai هیچ سطح batch منتشرشده‌ای نداره. فاصله به جای ۵ برابر به حدود ۲٫۵ برابر می‌رسه.

مورد محدود ۲

اشتراک در برابر API

Claude Max یا ChatGPT Pro با ۲۰۰ دلار در ماه عملاً استفاده نامحدود از بهترین مدل رو بسته‌بندی می‌کنن. این قیمت‌گذاری با نرخ‌های هر توکن API قابل مقایسه نیست.

مورد محدود ۳

بنچمارک‌های تکی

در ارزیابی‌های تکی (HLE، بعضی کارهای کدنویسی)، Opus 4.8 یا GPT-5.5 با سطح تلاش متوسط می‌تونن از GLM-5.2 بهتر عمل کنن. شاخص ترکیبی اون‌ها رو هم‌تراز نشون می‌ده.


داده‌ها چی می‌گن

سه جمع‌بندی. هزینه، هوش، دسترسی. داده‌ها روی هر سه صادقه.

GLM-5.2 در همه سطح‌های منتشرشده تلاش استدلال از Opus 4.8 و GPT-5.5 ارزون‌تره. در Artificial Analysis Intelligence Index v4.1 تقریباً با هر دو هم‌ترازه. از Z.ai با مجوز MIT میاد، یعنی خودمیزبانی، فاین‌تیونینگ و نبود هیچ وابستگی به فروشنده، گزینه‌های واقعیان. هیچ‌کدوم از مدل‌های فرانتیر اختصاصی همچین چیزی ارائه نمی‌دن.

برای اولین بار، یک مدل وزن باز در هزینه، هوش و دسترسی، رقیب رودرروی فرانتیره. این چیز درستی برای سازنده‌هایییه که نمی‌خوان به یک ارائه‌دهنده واحد وابسته باشن. هایپ درسته. روی تأخیر انتظارات رو تنظیم کن، بعد منتشر کن.


منابع

هر ادعای این صفحه به یک منبع دست‌اول برمی‌گرده. هیچ عدد ساختگی‌ای وجود نداره.

آخرین به‌روزرسانی: ۲۱ ژوئن ۲۰۲۶. قیمت‌ها در همین تاریخ از صفحه‌های قیمت‌گذاری دست‌اول گرفته شدن. Intelligence Index v4.1 در ۱۵ ژوئن ۲۰۲۶ منتشر شده.


وزن باز. هوش واقعی. مزیت هزینه واقعی.

GLM-5.2 در همه سطح‌های تلاش استدلال از Opus 4.8 و GPT-5.5 ارزون‌تره. در شاخص هوش با هر دو هم‌ترازه. مجوز MIT. خودمیزبانی، فاین‌تیونینگ، بدون وابستگی به فروشنده. فرانتیر بازه.

مخزن SpielOS رو کلون کن