GPT-5.6 چیست؟ راهنمای انتخاب Sol، Terra و Luna
English
پاسخ کوتاه: GPT‑5.6 یک خانواده سهسطحی است، نه یک مدل واحد که همیشه بهترین انتخاب باشد. Sol مدل پرچمدار برای مسئلههای سخت و پرریسک است، Terra تعادل توان و هزینه را برای کارهای روزمرهتر هدف میگیرد و Luna سریعترین و ارزانترین عضو خانواده برای حجم بالا و وظایف روشن است. انتخاب درست با نام مدل شروع نمیشود؛ با تعریف workload، معیار قبولی، بودجه latency و هزینه شکست آغاز میشود.
OpenAI این خانواده را در ۹ ژوئیه ۲۰۲۶ بهصورت عمومی عرضه کرد و در ۳۰ ژوئیه قیمت Terra و Luna را کاهش داد. در تاریخ بازبینی این مقاله، قیمت API بهازای یک میلیون توکن برای Sol برابر ۵ دلار ورودی و ۳۰ دلار خروجی، برای Terra برابر ۲٫۵ و ۱۵ دلار و برای Luna برابر ۱ و ۶ دلار اعلام شده است. قیمت، پلن و دسترسی میتوانند تغییر کنند؛ بنابراین این اعداد را snapshot تصمیمگیری بدانید و پیش از خرید از صفحه رسمی همان روز بخوانید.
نقشه ساده خانواده GPT-5.6
اسمهای Sol، Terra و Luna «نسخه کوچک و بزرگ یک پاسخ ثابت» نیستند. هر سطح یک نقطه متفاوت روی منحنی کیفیت، زمان و قیمت دارد. اگر task را اشتباه مسیریابی کنید، ممکن است برای یک استخراج ساده هزینه Sol بدهید یا برای یک migration حساس از Luna انتظار تصمیم معماری داشته باشید.
- Sol: مناسب مسئله مبهم، تحلیل چندمرحلهای، کدنویسی دشوار، پژوهش حرفهای و خروجیای که هزینه خطای آن بالاست.
- Terra: گزینه پیشفرض معقول برای تولید محتوا، تحلیل سند، کدنویسی معمول، پشتیبانی و جریانهایی که کیفیت خوب با هزینه کنترلشده میخواهند.
- Luna: مناسب طبقهبندی، استخراج، بازنویسی محدود، پاسخهای پرتعداد و subtaskهایی که قرارداد و schema روشن دارند.
این تقسیمبندی policy آماده نیست. OpenAI برای برخی benchmarkهای کدنویسی و دانشمحور عملکرد قدرتمندی در هر سه سطح گزارش کرده، اما benchmark عمومی نمیگوید invoice فارسی شما، repository واقعی تیم یا flow مشتری با چه نرخی پذیرفته میشود. policy باید با داده خودتان ساخته شود.
ChatGPT، Codex و API را با هم اشتباه نگیرید
یک نام مدل میتواند در چند سطح محصولی دیده شود، اما کنترلها و محدودیتها یکسان نیستند. در Chat معمولی، مدل و effort تحت تأثیر پلن و رابط انتخاب قرار میگیرند. در ChatGPT Work و Codex، کاربران واجد شرایط میتوانند میان اعضای خانواده و سطح effort انتخاب کنند. در API، شما خودتان routing، retry، cache، ابزارها، logging و معیار توقف را طراحی میکنید.
طبق راهنمای رسمی فعلی، کاربران Free و Go در ChatGPT Work و Codex به Terra دسترسی دارند و پلنهای Plus، Pro، Business و Enterprise میتوانند Sol، Terra و Luna را انتخاب کنند. Sol در Chat برای پلنهای Plus به بالا از effort متوسط و بیشتر عرضه میشود و Sol Pro برای Pro و Enterprise در دسترس است. این وضعیت ممکن است در rollout، منطقه یا workspace متفاوت باشد؛ داخل حساب خودتان read-back بگیرید.
برای تیم محصول، API آزادی بیشتری میدهد اما مسئولیت بیشتری هم میآورد. Programmatic Tool Calling میتواند داده میانی ابزارها را داخل یک برنامه سبک پردازش کند و multi-agent beta مسیرهای موازی بسازد. هیچکدام خودبهخود کیفیت را تضمین نمیکنند. اگر tool permission، schema، timeout و مشاهدهپذیری درست نباشد، مدل قویتر فقط سریعتر به اثر جانبی بزرگتر میرسد.
قیمت واقعی را با workload حساب کنید
قیمت فهرستشده فقط نرخ توکن است؛ هزینه پذیرفتهشدن خروجی از تعداد retry، طول context، خروجی، ابزار، cache و بازبینی انسانی میآید. فرض کنید یک درخواست ۲۰۰ هزار توکن ورودی و ۲۰ هزار توکن خروجی مصرف کند و cache نداشته باشد. هزینه تقریبی Sol برابر ۱٫۶ دلار، Terra برابر ۰٫۸ دلار و Luna برابر ۰٫۳۲ دلار میشود. این مثال هزینه ابزار بیرونی، ذخیرهسازی، retry و مالیات را در نظر نمیگیرد.
اگر Luna تنها در ۶۰ درصد موارد accepted شود و Sol در ۹۵ درصد، مقایسه ۰٫۳۲ با ۱٫۶ دلار گمراهکننده است. هزینه درست را میتوان اینطور دید: هزینه کل اجراها و بازبینی تقسیم بر تعداد خروجی پذیرفتهشده. گاهی مدل گرانتر بهدلیل کاهش retry ارزانتر تمام میشود؛ گاهی routing هوشمند با Luna و Terra بخش بزرگی از بار را میگیرد و فقط موارد دشوار را به Sol میفرستد.
GPT‑5.6 prompt caching با cache breakpoint صریح و حداقل عمر ۳۰ دقیقه ارائه شده است. cache write با ۱٫۲۵ برابر نرخ ورودی بدون cache محاسبه میشود و cache read تخفیف ۹۰ درصدی ورودی cached دارد. برای system prompt طولانی یا corpus ثابت، طراحی cache میتواند مهمتر از چند کلمه کوتاهکردن prompt باشد؛ اما hit rate را اندازه بگیرید و فرض نکنید هر درخواست cache میخورد.
ماتریس انتخاب بر اساس نوع کار
| نوع کار | شروع پیشنهادی | چه زمانی ارتقا دهیم؟ | معیار اصلی |
|---|---|---|---|
| استخراج ساختاریافته و برچسبگذاری پرتعداد | Luna | وقتی schema پیچیده یا خطای معنایی زیاد است | اعتبار JSON، precision و هزینه هر رکورد |
| پشتیبانی، خلاصهسازی و تولید پیشنویس | Terra | برای پرونده حساس یا context متناقض | groundedness، لحن و نرخ escalation |
| کدنویسی با task و تست روشن | Terra | برای debugging مبهم، معماری یا شکست تکراری | تست، diff و زمان تا merge |
| تحقیق چندمنبعی و تصمیم پرریسک | Sol | effort بالاتر پس از failure analysis | پوشش منبع، صحت و زمان بازبینی |
| کار چندایجنتی بلندمدت | Sol | فقط وقتی مسیرهای واقعاً مستقلاند | زمان تا نتیجه، conflict و مصرف کل |
این جدول نقطه شروع است، نه قانون. یک تیم میتواند Luna را برای تولید candidate و Terra را برای verifier استفاده کند. تیم دیگر ممکن است Terra را پیشفرض بگذارد و بر اساس confidence یا شکست validation به Sol escalate کند. مهم این است که مسیر ارتقا و بازگشت deterministic باشد، نه وابسته به حس اپراتور.
reasoning effort را جدا از مدل انتخاب کنید
مدل و effort دو اهرم متفاوتاند. بالا بردن effort میتواند زمان بیشتری برای بررسی گزینهها، اجرای check و اصلاح بدهد، اما latency و مصرف را بالا میبرد. برای task روشن، effort پایین یا متوسط را با acceptance test شروع کنید. اگر failure به کمبود بررسی مربوط است، effort را بالا ببرید؛ اگر failure از context ناقص، ابزار خراب یا معیار مبهم میآید، effort بیشتر مشکل طراحی را حل نمیکند.
سطح max زمان بیشتری نسبت به xhigh برای reasoning میدهد. ultra در محصولهای واجد شرایط چند agent را بهصورت موازی هماهنگ میکند و مصرف بیشتری دارد. چندایجنتی برای پژوهشهای مستقل یا ماژولهای جدا مفید است؛ برای یک فایل مشترک یا تصمیم زنجیرهای، هزینه هماهنگی و conflict ممکن است سود آن را خنثی کند.
یک آزمون کوچک پیش از rollout بسازید
- ۲۰ تا ۵۰ نمونه واقعی از کارتان انتخاب کنید؛ نه فقط promptهای نمایشی.
- پاسخ پذیرفتنی، خطاهای بحرانی و محدودیت latency را پیش از اجرا تعریف کنید.
- هر سه مدل را با prompt، ابزار و داده برابر آزمایش کنید.
- توکن، زمان، retry، خطای ابزار و دقیقه بازبینی انسانی را ثبت کنید.
- routing rule را روی cost per accepted result بنویسید و موارد مرزی را جدا کنید.
- پس از تغییر نسخه، قیمت یا prompt، نمونه را دوباره اجرا کنید.
برای رفتار ایجنتی، فقط کیفیت متن را نمره ندهید. انتخاب ابزار، رعایت permission، توقف ایمن و read-back مقصد را بسنجید. چارچوب ارزیابی ایجنت هوش مصنوعی این ابعاد را به تست تبدیل میکند. برای تاریخ، اعداد، راستبهچپ و لحن، از مجموعه آزمون فارسی استفاده کنید.
نکته دسترسی برای کاربران ایران
توانایی مدل در فارسی با دسترسی رسمی به سرویس یکی نیست. در تاریخ بازبینی این مقاله، ایران در فهرست رسمی کشورهای پشتیبانیشده ChatGPT نبود و OpenAI اعلام میکند دسترسی یا ارائه دسترسی خارج از فهرست میتواند به مسدود یا تعلیق حساب منجر شود. این مقاله روش دورزدن محدودیت جغرافیایی یا پرداخت ارائه نمیکند. پیش از وابستهکردن محصول یا مشتری، فهرست کشورها، شرایط حساب، محل پردازش داده و امکان پرداخت قانونی را از منبع رسمی بررسی کنید.
محدودیت benchmarkها و ادعاهای ایمنی
صفحه عرضه نتایج متعددی برای coding، browsing، دانش حرفهای، علم و امنیت گزارش میکند و system card درباره ارزیابی قابلیت و safeguard توضیح میدهد. این مدارک برای فهم جهت و مرز محصول مفیدند، اما جای آزمون مستقل شما را نمیگیرند. داده benchmark ممکن است prompt، ابزار، زمان و rubric متفاوتی با محیط واقعی شما داشته باشد.
برای کارهای حساس، مدل را تصمیمگیر نهایی قرار ندهید. دسترسی حداقلی، ثبت عملیات، تأیید انسانی، rollback و ارزیابی سوءاستفاده لازماند. در کدنویسی نیز جریان امن کدنویسی ایجنتی کمک میکند بین ساختهشدن، تست، deploy و تأیید واقعی تفاوت بگذارید.
جمعبندی
بهترین عضو GPT‑5.6 مدلی نیست که بالاترین نام یا قیمت را دارد؛ مدلی است که workload شما را با کمترین هزینه کل و نرخ خطای پذیرفتنی عبور میدهد. Luna را برای حجم و قرارداد روشن، Terra را بهعنوان پیشفرض متعادل و Sol را برای ابهام، ریسک و دشواری بالا آزمایش کنید. مدل، effort و محصول را جداگانه انتخاب کنید، cache و retry را در هزینه بیاورید و routing را با eval واقعی بهروزرسانی کنید.