از پیشنمایش تا رسمی: چه چیزی در ژوئیه تغییر میکنه
۲۴ آوریل پیشنمایش بود. اواسط ژوئیه، لانچ واقعیه. دو ماه استفاده در تولید، و حالا ارتقا به نسخه پایدار.
از ۲۴ آوریل، V4-Pro و V4-Flash توی پیشنمایش بودن: به اندازهی کافی پایدار برای کار تولیدی، ولی هنوز با برچسب پیشنمایش. DeepSeek در ۲۹ ژوئن ۲۰۲۶ تأیید کرد نسخه رسمی اواسط ژوئیه عرضه میشه. این یه ریلیز نقطهای نیست؛ نسخه رسمی بهبودهای عملکردی، کارایی بیشتر و یه مدل قیمتگذاری جدید میاره که اقتصاد استفاده از API توی ساعات اوج رو عوض میکنه.
اگه هنوز از deepseek-chat یا deepseek-reasoner استفاده میکنی، ۲۴ روز وقت داری تا مهاجرت کنی. این اندپوینتها بعد از ۲۴ ژوئیه دیگه کار نمیکنن.
قیمتگذاری پیک/غیرپیک: دو برابر در ساعات کاری
DeepSeek قیمتگذاری بر اساس ساعت شبانهروز معرفی میکنه. ساعات اوج دو برابر هزینه دارن؛ غیرپیک ثابت میمونه.
| مدل | ورودی غیرپیک | خروجی غیرپیک | ورودی پیک | خروجی پیک |
|---|---|---|---|---|
| DeepSeek V4-Flash | $۰٫۱۴ | $۰٫۲۸ | $۰٫۲۸ | $۰٫۵۶ |
| DeepSeek V4-Pro | $۰٫۴۳۵ | $۰٫۸۷ | $۰٫۸۷ | $۱٫۷۴ |
| Claude Opus 4.7 | $۵٫۰۰ | $۲۵٫۰۰ | $۵٫۰۰ | $۲۵٫۰۰ |
| GPT-5.5 | $۵٫۰۰ | $۳۰٫۰۰ | $۵٫۰۰ | $۳۰٫۰۰ |
ساعات اوج: هر روز ۹ صبح تا ۱۲ ظهر و ۲ تا ۶ عصر. حتی با قیمت پیک، خروجی V4-Flash بین ۴۴ تا ۵۳ برابر ارزانتر از GPT-5.5 هست.
مقایسه هزینه در پیک و غیرپیک
حتی با دو برابر قیمت، DeepSeek V4 باز هم خیلی ارزونتر از رقبای بستهست. مکانیزم پیک/غیرپیک برای مدیریت باره، نه برای گرفتن سود بیشتر.
DeepSeek میگه مکانیزم پیک/غیرپیک برای بهینهسازی تخصیص منابع و پایداری بیشتر سرویس طراحی شده. در ساعات اوج (هر روز ۹ صبح تا ۱۲ ظهر و ۲ تا ۶ عصر) قیمت API دو برابر میشه. نرخهای غیرپیک در سطح فعلی باقی میمونن. حتی با قیمت پیک، خروجی V4-Flash (۰٫۵۶ دلار به ازای هر میلیون توکن) ۵۳ برابر ارزانتر از GPT-5.5 (۳۰ دلار به ازای هر میلیون توکن) هست.
پیامد استراتژیک: کارهای دستهای، ورکفلوهای آسنکرون و استنتاجهای شبانه با همون نرخ فعلی اجرا میشن. این استفاده تعاملی و بلادرنگ توی ساعات کاریه که قیمت بالاتر رو میپردازه. این مدیریت باره، نه گرانفروشی.
DSpark: تولید ۸۵٪ سریعتر، حالا فعال
DeepSeek و دانشگاه پکینگ یه فریمورک شتابدهی استنتاج منتشر کردن. سرعت تولید تککاربره ۵۷ تا ۸۵٪ جهش کرده.
در ۲۷ ژوئن، DeepSeek با همکاری دانشگاه پکینگ DSpark — یه فریمورک شتابدهی استنتاج — رو منتشر کرد و همزمان DeepSpec، تولچین فولاستک دیکدینگ حدسی رو هم متنباز کرد. مقالهی تحقیقاتی که خود لیانگ ونفنگ، بنیانگذار DeepSeek نوشته، روی مخزنهای کد عمومی گذاشته شده.
این اولین ریلیز فنی متنباز بزرگ DeepSeek بعد از جذب سرمایهی ۶۹ میلیارد دلاریه. بنچمارکها تئوری نیستن: DSpark بهطور کامل روی سرویسهای آنلاین مستقر شده و توی تولید اعتبارسنجی شده.
نتیجهی DSpark اینه که لانچ ژوئیه سریعتر از پیشنمایش عرضه میشه. این بهبود سرعت استنتاج افزایشی نیست؛ کیفیت تعامل بلادرنگ هر دو مدل رو عوض میکنه.
مشخصات کامل مدلها
همهچیز تأییدشده از منابع رسمی، کارتهای مدل Hugging Face و گزارش فنی.
| مشخصات | V4-Pro | V4-Flash |
|---|---|---|
| کل پارامترها | ۱.۶ تریلیون | ۲۸۴ میلیارد |
| پارامترهای فعال / توکن | ۴۹ میلیارد | ۱۳ میلیارد |
| توکنهای پیشآموزش | ۳۳ تریلیون+ | |
| پنجره کانتکست | ۱,۰۰۰,۰۰۰ توکن (پیشفرض) | |
| حداکثر خروجی | ۳۸۴,۰۰۰ توکن | |
| معماری | مخلوطی از متخصصها (MoE)، 1 متخصص مشترک + 256 متخصص مسیریابیشده، top-k=8 | |
| اتنشن | ترکیبی: CSA + HCA (اتنشن اسپارس DeepSeek) | |
| لایسنس | MIT (وزنهای باز، استفاده تجاری، فاینتیون مجاز) | |
| حالتهای استدلال | Non-think، Think High، Think Max | |
| سازگاری API | فرمتهای OpenAI ChatCompletions و Anthropic API | |
مشخصات رسمی از مستندات API و کارتهای مدل Hugging Face.
متمایزکنندهی اصلی: V4 اولین خانواده مدلیه که از پایه حول کانتکست میلیونتوکنی بهعنوان پیشفرض ساخته شده، نه یه ویژگی که به مدل موجود اضافه شده باشه.
چه چیزی V4 رو زیر کاپوت متفاوت میکنه
سه نوآوری که کانتکست میلیونتوکنی رو در مقیاس تولید اقتصادی میکنن.
اتنشن ترکیبی: CSA + HCA اتنشن استاندارد پیچیدگی درجه دوم داره. در ۱ میلیون توکن، این غیرقابل تحمل میشه. DeepSeek دو مکانیزم رو در هم میبافه: اتنشن اسپارس فشرده (CSA) ورودیهای KV رو ۴ برابر فشرده میکنه و بعد یه ایندکسکننده برقآسا فقط بلوکهای top-k رو انتخاب میکنه. اتنشن بهشدت فشرده (HCA) ۱۲۸ برابر فشردهسازی میکنه و روی دنباله فشردهشده اتنشن متراکم اجرا میکنه. لایهها بین این دو مکانیزم جابهجا میشن. نتیجه: V4-Pro فقط به ۲۷٪ از FLOPs استنتاج تکتوکنی و ۱۰٪ از کش KV نسبت به V3.2 نیاز داره. V4-Flash این رو به ۱۰٪ از FLOPs و ۷٪ از کش KV میرسونه.
اتصالهای فرا-هایپر با قید منیفولد (mHC) اتصالهای باقیمانده (residual) معمولی یه دلتای بلوکی به نمایش جاری اضافه میکنن. وقتی دو نوع اتنشن برای استریم باقیمانده رقابت میکنن، سیگنالها میتونن انحراف پیدا کنن. mHC بهجای جمع ساده، از یه قید منیفولد استفاده میکنه و ماتریس نگاشت باقیمانده رو از طریق تکرار Sinkhorn-Knopp روی چندوجهی Birkhoff نگاشت میده. این کار نُرم طیفی رو محدود نگه میداره و انتشار سیگنال رو در لایههای عمیق پایدار نگه میداره. تأثیر عملی: mHC آموزش قابل اعتماد در ۱٫۶ تریلیون پارامتر رو ممکن میکنه. DeepSeek تنها لابه که مشکل پایداری آموزش رو حل کرده و داره همین رو توی تولید عرضه میکنه.
بهینهساز Muon + FP4 QAT در مقیاس فرانتیر DeepSeek برای آموزش V4، بهینهساز AdamW رو با Muon جایگزین کرد. Muon در مقیاس تریلیونپارامتری همگرایی سریعتر و پایداری آموزشی بیشتری میده. پارامترهای متخصص MoE با دقت FP4 استفاده میشن و بیشتر پارامترهای دیگه با FP8. این اولین آموزش آگاه به کوانتیزاسیون FP4 در مقیاس فرانتیره. هر دو مدل روی بیش از ۳۲ تریلیون توکن پیشآموزش دیدهان.
V4 در برابر فرانتیر کجای کاره
بنچمارکهای پیشنمایش قوی بودن. نسخه رسمی باید فاصلهها رو بیشتر ببنده. تصویر فعلی اینه:
| بنچمارک | V4-Pro Max | Claude Opus 4.7 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|
| SWE-bench Verified | ۸۰.۶% | ۸۷.۶% | ۷۶.۴% | ۸۰.۶% |
| SWE-bench Pro | ۵۵.۴% | ۶۴.۳% | ۵۸.۶% | ۵۴.۲% |
| LiveCodeBench | ۹۳.۵ | ۸۸.۸ | ۹۱.۲ | ۹۱.۷ |
| Codeforces Rating | ۳۲۰۶ | — | ۳۱۶۸ | ۳۰۵۲ |
| GPQA Diamond | ۹۰.۱ | ۹۴.۲ | ۹۳.۶ | ۹۴.۳ |
| MATH-۵۰۰ | ۹۶.۱% | ۹۴.۵% | — | ۹۳.۴% |
| Terminal-Bench ۲.۰ | ۶۷.۹% | ۶۹.۴% | ۸۲.۷% | ۶۸.۵% |
| Putnam-۲۰۲۵ | ۱۲۰/۱۲۰ | — | — | — |
| MRCR ۱M | ۸۳.۵ | ۹۲.۹ | — | ۷۶.۳ |
امتیازهای بنچمارک از گزارشهای دست اول و ارزیابیهای مستقل. برای کارهای استدلالی، حالت V4-Pro Max نشون داده شده.
V4 در برنامهنویسی رقابتی و ریاضی جلوئه. Claude در کدنویسی دنیای واقعی برتری داره. GPT-5.5 در کارهای ایجنتیک جلوئه. هیچ مدلی بهتنهایی سلطه نداره.
استدلال ریاضی: جایی که V4 سلطه داره
ریاضیات صوری جاییه که V4 بهوضوح از بقیه جلو میزنه. نمرههای کامل در جاهایی که رقبا عقب میمونن.
برای ورکفلوهای ریاضیمحور، V4-Pro با یکنهم هزینه GPT-5.5 نتایج قابل مقایسهای میده. نمره کامل در Putnam سیگناله که قابلیت استدلال صوری به رده جدیدی رسیده.
۱ میلیون توکن: پیشفرض، نه یه قابلیت
هر دو مدل بهصورت بومی از کانتکست ۱ میلیون توکنی پشتیبانی میکنن. هیچ پلن خاصی. هیچ هزینه اضافی. این پیشفرضه.
| بنچمارک کانتکست طولانی | V4-Pro | Claude Opus 4.6 | Gemini 3.1 Pro |
|---|---|---|---|
| MRCR ۱M (دقت بازیابی) | ۸۳.۵ | ۹۲.۹ | ۷۶.۳ |
| CorpusQA ۱M (پاسخ به سوال روی سند واقعی) | ۶۲.۰% | ۷۱.۷% | ۵۳.۸% |
| MRCR ۱۲۸K | ۹۴% | ۹۶% | ۸۹% |
در ۱ میلیون توکن، V4-Pro تا ۱۲۸ هزار توکن دقت بازیابی ۹۴٪ رو حفظ میکنه، در ۵۱۲ هزار توکن ۸۲٪ و در ۱ میلیون توکن همچنان ۶۶٪ میمونه. DeepSeek گزارش میده V4-Pro در بنچمارک MRCR از Gemini-3.1-Pro بهتر عمل میکنه (۸۳٫۵ در برابر ۷۶٫۳) اما همچنان از Claude Opus 4.6 (۹۲٫۹) عقبتره.
در CorpusQA، بنچمارکی که به استفاده واقعی از اسناد طولانی نزدیکتره، V4-Pro در ۱ میلیون توکن به ۶۲٫۰٪ میرسه و Gemini 3.1 Pro با ۵۳٫۸٪ رو شکست میده. توی پاسخگویی به سوال روی اسناد طولانی، V4-Pro واقعاً با رهبران کانتکست طولانیِ بسته رقابت میکنه.
تأثیر عملی: لود کردن یه کدبیس کامل توی کانتکست ۱ میلیون توکنی، با Flash فقط ۰٫۱۴ دلار به ازای هر فراخوانی آب میخوره. این تفاوت جزئی نیست؛ عوض میکنه چی میتونی بسازی.
قابلیتهای ایجنتیک: مرز جدید
V4-Pro با Claude Code، OpenClaw و OpenCode یکپارچه شده. این مدل برای ورکفلوهای ایجنتیک ساخته شده.
| بنچمارک ایجنتیک | V4-Pro Max | V4-Flash Max | Claude Opus 4.7 |
|---|---|---|---|
| SWE-Bench Verified | ۸۰.۶% | ۷۲.۳% | ۸۷.۶% |
| SWE-Bench Pro | ۵۵.۴% | ۴۲.۱% | ۶۴.۳% |
| Terminal Bench ۲.۰ | ۶۷.۹% | ۵۶.۹% | ۶۹.۴% |
| MCPAtlas | ۷۳.۶ | ۶۱.۲ | ۷۳.۸ |
| Toolathlon | ۵۱.۸ | ۴۳.۷ | ۴۷.۰ |
اعداد MCPAtlas و Toolathlon مهمن چون این بنچمارکها یه طیف گسترده از ابزارهای خارجی و سرویسهای MCP رو ارزیابی میکنن. یه امتیاز قوی یعنی مدل فراتر از هر هارنس ایجنت داخلی که DeepSeek موقع RL استفاده کرده، تعمیم پیدا میکنه.
برای استفاده ایجنتیک، Pro مدل درسته. برای ورکفلوهای چت و استدلال، Flash به اندازه کافی به Pro نزدیکه که نسبت قیمت به کارایی معمولاً به نفعشه. V4-Flash-Max در Terminal Bench 2.0 به ۵۶٫۹٪ میرسه؛ ۱۱ واحد عقبتر از Pro.
پستهای برتر X، تاپیکهای Reddit و هیاهوی جامعه
جامعه AI در X، Reddit، HuggingFace و Hacker News واکنش نشون داد. سه تم غالب بود.
واکنش جامعه فقط کامنت نبود؛ پذیرش بود. V4-Pro ظرف چند روز به بیش از ۱۲۳٬۰۰۰ دانلود روی Hugging Face رسید. جامعه NVIDIA DGX Spark استقرارهای ۱ میلیون کانتکستی قابل اجرا در تولید ساختن. داستانهای کاهش هزینه واقعیان، نه تئوری.
مقالات خبری برتر و پوشش رسانهای
همه رسانههای مهم AI به V4 پرداختن. پوشش روی سه زاویه متمرکز بود: بههمریختن قیمت، پیامدهای وزن باز و ریسک ژئوپلیتیک.
الگوی پوشش رسانهای ثابته: V4 در قیمت و برنامهنویسی رقابتی برندهست، در مهندسی نرمافزار دنیای واقعی و کارهای ایجنتیک عقب میمونه و لایسنس MIT با وزنهای باز، معادله خودمیزبانی رو کاملاً عوض میکنه.
مهلت ۲۴ ژوئیه: بازنشستگی API قدیمی
اگه از deepseek-chat یا deepseek-reasoner استفاده میکنی، ۲۴ روز برای مهاجرت وقت داری. بعد از ۲۴ ژوئیه، این اندپوینتها از کار میفتن.
مهاجرت سادهست: پارامتر مدل رو از deepseek-chat به deepseek-v4-flash تغییر بده، یا از deepseek-reasoner به deepseek-v4-pro. آدرس پایه API ثابت میمونه و هم فرمت OpenAI ChatCompletions هم فرمت API انتروپیک پشتیبانی میشه.
DeepSeek توصیه میکنه همین حالا مهاجرت کنی و دوباره تست بگیری، بهجای اینکه تا ژوئیه صبر کنی. رفتار در مرحله پیشنمایش میتونه تغییر کنه. مهلت ۲۴ ژوئیه قطعیه.
لایه امنیتی و ژئوپلیتیک
محدودیتهای دولتی، نگرانیهای محل نگهداری داده، اتهامات استخراج دانش و زاویه خودمیزبانی.
سوال این نیست که API میزبانشده برای دادههای تحت نظارت امنه یا نه. نیست. سوال اینه که مدل وزنبازِ خودمیزبان معادله رو عوض میکنه یا نه. برای خیلی از کاربردها، عوض میکنه.
تصویر کامل قیمتگذاری
هزینههای غیرپیک، پیک، کشهیت و خودمیزبان. کل تحلیل اقتصادی.
| مدل | ورودی / میلیون توکن | خروجی / میلیون توکن | ورودی کشهیت | کانتکست |
|---|---|---|---|---|
| V4-Flash (غیرپیک) | $۰.۱۴ | $۰.۲۸ | $۰.۰۰۲۸ | ۱M |
| V4-Flash (پیک) | $۰.۲۸ | $۰.۵۶ | $۰.۰۰۵۶ | ۱M |
| V4-Pro (غیرپیک) | $۰.۴۳۵ | $۰.۸۷ | $۰.۰۰۳۶ | ۱M |
| V4-Pro (پیک) | $۰.۸۷ | $۱.۷۴ | $۰.۰۰۷۲ | ۱M |
| Claude Opus 4.7 | $۵.۰۰ | $۲۵.۰۰ | $۰.۵۰ | ۱M |
| GPT-5.5 | $۵.۰۰ | $۳۰.۰۰ | $۰.۵۰ | ۱M |
قیمتگذاری کامل تا ژوئیه ۲۰۲۶. ساعات اوج: هر روز ۹ صبح تا ۱۲ ظهر و ۲ تا ۶ عصر. قیمتگذاری کشهیت ۹۸٪ کاهش نسبت به کشمیس ارائه میده.
برای یه ورکفلو واقعی: پردازش ۱۰ میلیون توکن خروجی با V4-Flash در غیرپیک ۲٫۸۰ دلار، در پیک ۵٫۶۰ دلار، با V4-Pro در غیرپیک ۳۴٫۸۰ دلار، با Claude Opus 4.7، ۲۵۰ دلار و با GPT-5.5، ۳۰۰ دلار هزینه داره.
قیمتگذاری کشهیت همونجاییه که V4 حتی جلوتر میافته. ورودی کشهیت V4-Flash ۰٫۰۰۲۸ دلار به ازای هر میلیون توکنه؛ ۹۸٪ کاهش نسبت به کشمیس. برای ورکفلوهای تکراری با پرامپتهای مشابه، هزینه مؤثر به صفر نزدیک میشه.
مقایسه واقعی: کدوم مدل برای کدوم کار
به لیدربورد نگاه نکن؛ به ماتریس کارها نگاه کن. مدلهای مختلف برای ورکفلوهای مختلف.
| کاربرد | بهترین مدل | چرا |
|---|---|---|
| تماسهای API پرحجم در تولید | DeepSeek V4-Flash | $۰.۱۴/$۰.۲۸ به ازای هر M توکن در غیرپیک، ۹۷-۱۰۷ برابر ارزانتر از GPT-5.5 |
| کیفیت فرانتیر با بودجه محدود | DeepSeek V4-Pro | ۸۰.۶% در SWE-Bench با هزینه ۱۱ برابر کمتر از Opus |
| برنامهنویسی رقابتی | DeepSeek V4-Pro | Codeforces با ریتینگ ۳۲۰۶، بالاترین ریتینگ تاریخ AI |
| استدلال ریاضی و STEM | DeepSeek V4-Pro | MATH-۵۰۰ با ۹۶.۱%، Putnam-۲۰۲۵ با ۱۲۰/۱۲۰ |
| خودمیزبانی یا استقرار ایزوله (air-gapped) | DeepSeek V4-Pro | وزنهای باز با لایسنس MIT، ۸۶۵ گیگابایت |
| فاینتیون روی داده اختصاصی | DeepSeek V4-Pro | وزنهای باز امکان فاینتیون کامل و استفاده تجاری رو میدن |
| کدنویسی ایجنتیک ترمینالمحور | GPT-5.5 | ۸۲.۷% در Terminal-Bench ۲.۰ |
| بازبینی و ریفکتور PRهای حساس | Claude Opus 4.7 | ۸۷.۶% در SWE-bench Verified، قویترین خودتأییدی |
| خودمختاری طولانی + استفاده از کامپیوتر | GPT-5.5 | کامپیوتر یوز بومی، افق کاری خودمختار 7+ ساعته |
| گستردهترین اکوسیستم ایجنت | GPT-5.5 | وسیعترین پشتیبانی از فراخوانی ابزار، استاندارد عملی |
استراتژی چندمدلی
بهترین سازندهها دارن یه لایه مسیریابی میسازن. مدلهای مختلف برای کارهای مختلف.
یه لایه مسیریابی خوب طراحیشده که ۶۰-۷۰٪ ترافیک رو به V4-Flash میفرسته، کدنویسی رو به V4-Pro یا Opus 4.7 ارتقا میده و برای کارهای ایجنتیک دسکتاپ از GPT-5.5 استفاده میکنه، میتونه هزینهها رو ۴۰-۶۰٪ نسبت به رویکرد تکمدلی کاهش بده و همزمان کیفیت رو در همه انواع کارها حفظ یا بهبود بده.
بیشتر کالها روتینن. بعضی کالها کیفیت فرانتیر میخوان. تعداد کمی هم عمق خودمختاری لازم دارن. برای توزیع واقعی کارها در تولید بهینه کن.
لانچ رسمی V4 باید چه چیزهایی بیاره
بر اساس اظهارات DeepSeek و الگوی پیشنمایش به پایدار، این چیزیه که اواسط ژوئیه تغییر میکنه.
منابع
هر ادعایی در این صفحه به یه منبع دست اول یا تأییدشده وصل میشه. هیچ عددی از خودمون درنیاوردیم.
آخرین بهروزرسانی: ۲۹ ژوئیه ۲۰۲۶. قیمتها از مستندات رسمی API دیپسیک. امتیازهای بنچمارک از گزارشهای دست اول و ارزیابیهای مستقل. بحثهای جامعه از Reddit، X، HN و HuggingFace جمعآوری شده.
پیشنمایش خوب بود؛ نسخه رسمی باید بهتر باشه.
DeepSeek V4 توی آوریل اقتصاد AI رو بازنویسی کرد. لانچ رسمی ژوئیه اون رو دائمی میکنه. اگه هنوز برای کارهایی که V4 با ۰٫۲۸ تا ۰٫۸۷ دلار انجام میده، ۲۵ تا ۳۰ دلار به ازای هر میلیون توکن خروجی پرداخت میکنی، سوال این نیست که سوییچ کنی یا نه؛ سوال اینه که چقدر سریع میتونی مهاجرت کنی.
ریپوی SpielOS رو کلون کن