آوریل ۲۰۲۶ اقتصاد AI رو عوض کرد
سه مدل فرانتیر در هشت روز. جنگ قیمتها هستهای شد.
سه مدل فرانتیر در عرض هشت روز منتشر شدن. Claude Opus 4.7 در ۱۶ آوریل اومد. GPT-5.5 در ۲۳ آوریل رونمایی شد. DeepSeek V4 هم در ۲۴ آوریل — دقیقاً همون روز GPT-5.5 — با دو مدل وزنباز تحت لایسنس MIT و قیمتگذاریای رسید که کل صنعت رو مجبور کرد حاشیه سودش رو دوباره حساب کنه.
دو مدل، نه یکی
DeepSeek یک مدل پرچمدار و یک مدل کاراییمحور منتشر کرد. هر دو بهصورت پیشفرض کانتکست یک میلیون توکنی دارن.
هر دو مدل پنجره کانتکست یک میلیون توکنی مشترک دارن که حالا پیشفرض همه سرویسهای رسمی DeepSeek شده. هر دو از سه حالت استدلال پشتیبانی میکنن. نامهای قدیمی مدلهای API یعنی `deepseek-chat` و `deepseek-reasoner` در ۲۴ جولای ۲۰۲۶ بازنشسته میشن.
کانتکست ۱ میلیون توکنی دیگه یه ویژگی پریمیوم نیست؛ پیشفرضه. بارگذاری کل یک کدبیس با Flash به ازای هر فراخوانی فقط ۰٫۱۴ دلار هزینه داره.
اعدادی که بازار رو به هم ریخت
قیمتگذاری به ازای هر توکن در سطح فرانتیر. ورودی DeepSeek V4-Flash حدود ۳۵ برابر ارزانتر از GPT-5.5 هست؛ خروجی هم ۱۰۷ برابر.
| مدل | ورودی /M توکن | خروجی /M توکن | کانتکست |
|---|---|---|---|
| DeepSeek V4-Flash | $۰.۱۴ | $۰.۲۸ | ۱M |
| DeepSeek V4-Pro | $۰.۴۳۵ | $۰.۸۷ | ۱M |
| Google Gemini 3.1 Pro | $۲.۰۰ | $۱۲.۰۰ | ۱M |
| Claude Opus 4.7 | $۵.۰۰ | $۲۵.۰۰ | ۱M |
| GPT-5.5 | $۵.۰۰ | $۳۰.۰۰ | ۱M |
این اختلاف جزئی نیست. این یعنی با اقتصاد محصولی کاملاً متفاوت طرفیم.
برای یک ورکفلو واقعی: کاری که با DeepSeek V4 حدود ۵٫۲۲ دلار هزینه داره، با GPT-5.5 حدود ۳۵ دلار آب میخوره. پردازش ۱۰ میلیون توکن خروجی با V4-Flash حدود ۲٫۸ دلار، با V4-Pro حدود ۳۴٫۸ دلار، با Claude Opus 4.7 حدود ۲۵۰ دلار و با GPT-5.5 حدود ۳۰۰ دلار.
چطور کانتکست یک میلیون توکنی اقتصادی شد
سه نوآوری که کانتکست میلیون توکنی رو از چیزی گرانقیمت به امری عادی تبدیل کردن.
Hybrid Attention: CSA + HCA attention معمولی پیچیدگی درجهدوم داره. در کانتکست یک میلیون توکنی، این غیرقابل تحمل میشه. DeepSeek دو مکانیزم رو بهصورت متناوب کنار هم میچینه: Compressed Sparse Attention (CSA) ورودیهای KV رو ۴ برابر فشرده میکنه و بعد یک ایندکسر سریع فقط بلاکهای top-k رو انتخاب میکنه. Heavily Compressed Attention (HCA) هم فشردهسازی ۱۲۸ برابری انجام میده و attention متراکم رو روی دنباله فشرده اجرا میکنه. لایهها بین این دو مکانیزم جابهجا میشن. نتیجه: V4-Pro برای استنتاج هر توکن فقط به ۲۷٪ از FLOPها و ۱۰٪ از حافظه کش KV نسبت به V3.2 نیاز داره. V4-Flash این عدد رو به ۱۰٪ از FLOPها و ۷٪ از حافظه کش KV میرسونه.
Manifold-Constrained Hyper-Connections (mHC) اتصالات باقیمانده متعارف، دلتای هر بلاک رو به نمایش جاری اضافه میکنن. وقتی دو نوع attention برای جریان residual رقابت میکنن، سیگنالها میتونن انحراف پیدا کنن. mHC بهجای جمع ساده از یک قید منیفولد استفاده میکنه و ماتریس نگاشت باقیمانده رو از طریق تکرار Sinkhorn-Knopp روی polytope برخوف نگاشت میده. این کار نُرم اسپکترال رو محدود نگه میداره و انتشار سیگنال رو در عمق زیاد شبکه پایدار نگه میداره. اثر عملی: mHC آموزش مطمئن با ۱٫۶ تریلیون پارامتر رو ممکن میکنه.
Muon Optimizer DeepSeek برای آموزش V4 بهجای AdamW از بهینهساز Muon استفاده کرد. Muon همگرایی سریعتر و پایداری بیشتر آموزش در مقیاس تریلیون پارامتر میده و با یک استراتژی هیبریدی سفارشی ZeRO برای آموزش توزیعشده جفت شده. هر دو مدل روی بیشتر از ۳۲ تریلیون توکن پیشآموزش دیدن.
تصویر دقیق بنچمارکها
جدول ردهبندی خام یک داستان تعریف میکنه؛ تفکیک وظایف داستان دیگهای.
| بنچمارک | V4-Pro Max | Claude Opus 4.7 | GPT-5.5 |
|---|---|---|---|
| SWE-bench Pro | ۵۵.۴% | ۶۴.۳% | ۵۸.۶% |
| SWE-bench Verified | ۸۰.۶% | ۸۷.۶% | ۷۶.۴% |
| Terminal-Bench ۲.۰ | ۶۷.۹% | ۶۹.۴% | ۸۲.۷% |
| LiveCodeBench | ۹۳.۵ | ۸۸.۸ | ۹۱.۲ |
| GPQA Diamond | ۹۰.۱ | ۹۴.۲ | ۹۳.۶ |
| Codeforces Rating | ۳۲۰۶ | — | ۳۱۶۸ |
| MATH-۵۰۰ | ۹۶.۱% | ۹۴.۵% | — |
| BrowseComp | ۸۳.۴% | ۸۳.۷% | ۸۴.۴% |
Claude Opus 4.7 در مهندسی نرمافزار دنیای واقعی میدرخشه. ۶۴٫۳٪ در SWE-bench Pro و ۸۷٫۶٪ در SWE-bench Verified. رفتار خودتأییدیاش بهترین انتخاب برای تغییرات کد در محیط تولیده.
GPT-5.5 در ورکفلوهای ایجنتیک خودمختار برندهست. ۸۲٫۷٪ در Terminal-Bench 2.0. اگه ایجنت کدنویس تو باید توی فایلسیستمها پیمایش کنه، ابزارهای build رو اجرا کنه و دستورات شل رو ارکستریشن کنه، GPT-5.5 قویترین گزینهست.
DeepSeek V4-Pro در برنامهنویسی رقابتی و ریاضی پیشتازه. ریتینگ ۳۲۰۶ در Codeforces — بالاترین ریتینگ AI در تاریخ. MATH-500 با ۹۶٫۱٪. LiveCodeBench با ۹۳٫۵، بهترین امتیاز.
Claude در کیفیت کدنویسی پیشتازه. GPT-5.5 در کارهای ایجنتیک میدرخشه. DeepSeek V4-Pro بهترین برنامهنویسی رقابتی و ریاضی رو با کسری از هزینه ارائه میده.
واکنش اینترنت چطور بود
کامیونیتی AI بلافاصله واکنش نشون داد. سه تم اصلی روی X، Reddit، Hacker News و HuggingFace.
V4-Pro ظرف چند روز از انتشار به بیش از ۱۲۳ هزار دانلود روی Hugging Face رسید. واکنش کامیونیتی فقط کامنت نبود؛ پذیرش واقعی بود.
بخشی که بیشتر مقایسهها نادیده میگیرن
ممنوعیتهای دولتی، نگرانیهای محل ذخیره داده، اتهامات استخراج دانش و زاویه سلفهاستینگ.
سؤال این نیست که API میزبانیشده برای دادههای دارای مقررات امنه یا نه. نیست. سؤال اینه که آیا مدل وزنباز، وقتی خودت میزبانش میشی، معادله رو عوض میکنه یا نه. برای خیلی از کاربردها، میکنه.وقتی V4 رو روی زیرساخت غیرچینی اجرا میکنی، نگرانی انتقال داده از بین میره.
لایسنس MIT استفاده تجاری کامل، اصلاح و بازتوزیع رو مجاز میکنه. برای انطباق با GDPR، سلفهاستینگ روی سرورهای داخل اتحادیه اروپا یعنی داده هرگز به چین نمیرسه. مدل وزنبازی که خودت میزبانش میشی، محصولی متفاوت از API میزبانیشدهست.
مقایسه واقعی
از جدول ردهبندی دست بردار. به ماتریس کارها نگاه کن. مدلهای متفاوت برای ورکفلوهای متفاوت.
| کاربرد | بهترین مدل | چرا |
|---|---|---|
| تماسهای API پرمصرف در تولید | DeepSeek V4-Flash | $۰.۱۴/$۰.۲۸ به ازای هر M توکن، ۹۷-۱۰۷ برابر ارزانتر از GPT-5.5 |
| کیفیت فرانتیر با بودجه محدود | DeepSeek V4-Pro | ۸۰.۶% در SWE-Bench با هزینه ۱۱ برابر کمتر از Opus |
| کدنویسی ایجنتیک سنگین با ترمینال | GPT-5.5 | ۸۲.۷% در Terminal-Bench ۲.۰ |
| بازبینی و ریفکتور PRهای حساس | Claude Opus 4.7 | ۸۷.۶% در SWE-bench Verified، قویترین خودتأییدی |
| خودمختاری طولانی + استفاده از کامپیوتر | GPT-5.5 | پشتیبانی بومی از computer use، افق کاری خودمختار 7+ ساعته |
| سلفهاستینگ یا استقرار ایزوله | DeepSeek V4-Pro | وزنهای باز با لایسنس MIT، ۸۶۵ گیگابایت |
| فاینتیون روی داده اختصاصی | DeepSeek V4-Pro | وزنهای باز امکان فاینتیون کامل رو میدن |
| برنامهنویسی رقابتی | DeepSeek V4-Pro | ریتینگ ۳۲۰۶ در Codeforces، بالاترین ریتینگ AI تا به امروز |
| استدلال ریاضی و STEM | DeepSeek V4-Pro | ۹۶.۱% در MATH-۵۰۰، بهتر از Claude و GPT |
| وسیعترین اکوسیستم ایجنت | GPT-5.5 | گستردهترین پشتیبانی از فراخوانی ابزار، استاندارد دوفاکتو |
از انتخاب یک مدل دست بردار
باهوشترین سازندهها دارن یک لایه مسیریابی میسازن. مدلهای متفاوت برای کارهای متفاوت.
بیشتر فراخوانیها روتینن. بعضیها به کیفیت فرانتیر نیاز دارن. تعداد کمی هم به عمق خودمختاری نیاز دارن. برای توزیع واقعی کارها در تولید بهینهسازی کن.
چهار چیز که DeepSeek درست انجام داد
زیرساخت، نه فقط مارکتینگ. ریاضیات قیمتگذاری غیرقابل انکاره.
چهار چیز که DeepSeek اشتباه انجام داد
شکافهایی که اهمیت دارن: مستندات امنیتی، مولتیمودالیتی، سختافزار مصرفی و اتهامات حلنشده.
منابع
هر ادعای این صفحه به یک منبع رسمی وصل میشه. هیچ عددی جعل نشده.
آخرین بهروزرسانی: ۲۷ جولای ۲۰۲۶. قیمتها از صفحات رسمی قیمتگذاری. امتیازهای بنچمارک از گزارشهای رسمی و ارزیابیهای مستقل.
لانچ رسمی V4
پیشنمایش فقط شروع بود. لانچ رسمی و پایدار در جولای همهچیز رو عوض میکنه: قیمتگذاری پیکولهای، افزایش سرعت DSpark و مهلت بازنشستگی API قدیمی.
این پست نسخه اولیه پیشنمایش V4 و تحلیل بنچمارکها رو پوشش میده. برای آخرین اخبار لانچ رسمی پایدار، قیمتگذاری پیکولهای و DSpark، بررسی کامل لانچ جولای رو بخون.
تولید شده با SpielOS
این پست با پایپلاین محتوای SpielOS — یک موتور محتوای متنباز که سشنها رو به استراتژی تبدیل میکنه — تحقیق، نوشتن و منتشر شده.
سؤال این نیست که کدوم مدل بهترینه. سؤال اینه که کدوم مدل برای این کار خاص، با این هزینه خاص و با این محدودیتهای خاص بهترینه.
DeepSeek V4 جنگ اقتصاد رو برد. Claude در کدنویسی پیشتازه. GPT-5.5 در ایجنتها پیشتازه. DeepSeek سؤال رو مطرح کرد. برای همین مهمه.
لانچ رسمی V4 رو بخوان