GPT-6 Astra و بنچمارک ARC-AGI-3: عدد ۹۹.۹٪ چه چیزی را واقعاً نشان میدهد؟
اوپنایآی میگوید GPT-6 Astra بنچمارک ARC-AGI-3 را با ۹۹.۹٪ اشباع کرده؛ اما همین مدل با روش استاندارد اندازهگیری فقط ۶۲.۷٪ گرفته. بررسی دقیق اینکه این فاصله از کجا میآید و چه معنایی دارد.
در این ویدیوی رسمی، اوپنایآی مدل تازهاش GPT-6 Astra را بهعنوان «هوشمندترین و همسوترین» مدلی که تا امروز ساخته، معرفی میکند و روی قابلیت تازهٔ «استفاده از کامپیوتر» تمرکز دارد؛ یعنی مدلی که میتواند مثل یک انسان با صفحهنمایش، برنامهها و مرورگر کار کند.
اوپنایآی در ۳ سپتامبر ۲۰۲۶ از GPT-6 Astra رونمایی کرد و در همان اعلامیه نوشت این مدل بنچمارک ARC-AGI-3 را با نمرهٔ ۹۹.۹٪ «اشباع» کرده است؛ عددی که در چند ساعت به تیتر اول رسانههای فناوری تبدیل شد. اما همان روز، خودِ سازندگان این بنچمارک یعنی تیم ARC Prize یک نکتهٔ کلیدی را هم منتشر کردند: همین مدل، با تنظیمات اندازهگیری متفاوت، عدد ۶۲.۷٪ هم گرفته است. این مقاله دقیقاً همین فاصله را بررسی میکند: مدل چه تغییری کرده، بنچمارک چه چیزی را واقعاً میسنجد، و چرا یک مدل واحد دو نمرهٔ اینقدر متفاوت گرفته است.
چهچیزی در Astra واقعاً تازه است؟
مهمترین قابلیت تازهٔ Astra چیزی است که اوپنایآی آن را استفاده از کامپیوتر (Computer Use) مینامد: مدل میتواند صفحهنمایش را ببیند، ماوس و صفحهکلید را کنترل کند و کارهایی مثل پرکردن یک فرم، ساخت یک فایل سهبعدی در نرمافزار Blender یا ثبت یک آگهی روی eBay را مستقیماً از روی یک دستور صوتی انجام دهد؛ بدون اینکه کاربر مرحلهبهمرحله راهنماییاش کند.
گرگ برکمن، رئیس اوپنایآی، این مدل را یک «جهش نسلی» توصیف کرد و گفت شاید در آینده به آن بهعنوان نقطهٔ شروع هوش مصنوعی عمومی (AGI) نگاه شود؛ ادعایی بزرگ که در ادامهٔ همین مقاله آن را کنار حرف خودِ سازندگان بنچمارک میگذاریم.
نکتهٔ کمتر گفتهشده این است که این عرضه با تأخیر همراه بود. اوپنایآی پس از یک حادثهٔ امنیتی در تیر ۱۴۰۵ (ژوئیهٔ ۲۰۲۶) روی پلتفرم Hugging Face، عرضهٔ مدل بعدیاش را عقب انداخت تا لایههای ایمنی بیشتری اضافه کند. قیمت Astra هم در سطح API حدود ۲.۵ برابر نرخ تبلیغاتی مدل قبلی، GPT-5.6 Sol، است؛ ۱۰ دلار برای هر میلیون توکن ورودی و ۵۰ دلار برای هر میلیون توکن خروجی.
بنچمارک ARC-AGI-3 چیست؟
ARC-AGI-3 برای سنجش چیزی طراحی شده که به آن هوش عاملمحور (Agentic Intelligence) میگویند: توانایی یک مدل برای کاوش در یک محیط کاملاً تازه، فهمیدن قوانین آن بدون راهنمای ازقبلنوشتهشده، و رسیدن به یک هدف با آزمونوخطای هوشمندانه. برخلاف بیشتر بنچمارکهای رایج که یکبار سؤال میپرسند و یکبار جواب میگیرند، محیطهای ARC-AGI-3 نوبتی و انتزاعیاند؛ یعنی مدل باید طی چند مرحله، رفتارش را بر اساس چیزی که تازه یاد گرفته، تغییر دهد.
این بنچمارک چهار توانایی را جدا از هم میسنجد: کاوش یعنی بهدستآوردن فعالانهٔ اطلاعات بهجای منتظرماندن، مدلسازی یعنی تبدیل مشاهدات به یک پیشبینی قابلتعمیم، هدفگذاری یعنی پیداکردن وضعیت مطلوب با پاداشهای کم و پراکنده، و برنامهریزی و اجرا یعنی طراحی مسیر رسیدن به هدف و اصلاح آن در حین کار.
دلیل وجود نسل سوم این بنچمارک هم خودش گویاست: نسل اول و دوم ARC-AGI پیشتر تا حد زیادی توسط مدلهای پیشرفته «اشباع» شده بودند، یعنی مدلها یاد گرفته بودند آنها را حل کنند. این یک الگوی تکرارشونده است؛ هر نسل بنچمارک تا وقتی مدلها به آن عادت نکردهاند سخت بهنظر میرسد، و هر بار طراحان مجبورند نسخهٔ سختتری بسازند.
عدد ۹۹.۹٪ در برابر ۶۲.۷٪: ماجرا از چه قرار است؟
اینجا بخش اصلی ماجراست. Astra روی همان مجموعهٔ آزمون ARC-AGI-3، دو نمرهٔ کاملاً متفاوت گرفته و تفاوت، نه در خودِ مدل، بلکه در چیزی است که ARC Prize آن را هارنس (Harness) مینامد؛ یعنی لایهٔ نرمافزاری اطراف مدل که تعیین میکند مدل چطور با محیط تعامل کند و چهچیزی را بین مراحل مختلف بهخاطر بسپارد.
با هارنس استاندارد — یک رابط خنثی و یکسان برای همهٔ شرکتها، که مقایسهٔ منصفانهٔ مدلهای مختلف را ممکن میکند — Astra نمرهٔ ۶۲.۷٪ گرفت؛ با هزینهٔ نزدیک به ۲۶ هزار دلار محاسبات. اما با هارنس اختصاصی اوپنایآی (Provider Adapter) که به مدل اجازه میدهد وضعیت استدلال داخلیاش را بین درخواستهای مختلف حفظ کند و گفتوگوهای طولانی را فشردهسازی کند، همان مدل به ۹۹.۹٪ رسید؛ اینبار با حدود ۱۹ هزار دلار محاسبات، یعنی حتی ارزانتر.
اشباع این بنچمارک به معنای اثبات رسیدن به هوش مصنوعی عمومی نیست.
این جمله را خودِ تیم ARC Prize، سازندهٔ بنچمارک، در تحلیل رسمیشان دربارهٔ نتیجهٔ Astra نوشتند. آنها تأکید کردند که ARC-AGI-3 هرچند نشاندهندهٔ «پیشرفت واقعی بهسمت تعمیمپذیری» است، اما دامنهاش محدود و از پیش تعیینشده است؛ مکانیکهای آن قطعی و بستهاند، برخلاف پیچیدگی و عدمقطعیت دنیای واقعی. به زبان ساده: عدد ۹۹.۹٪ واقعی است، اما دقیقاً همان چیزی نیست که بیشتر مردم با شنیدنش تصور میکنند.
این ویدیوی رسمی برای برنامهنویسان است و دقیقاً همان تفاوت را از زاویهٔ فنی نشان میدهد: چطور حفظکردن وضعیت استدلال بین درخواستها (Reasoning State) و فشردهسازی مکالمههای طولانی، به مدل اجازه میدهد کارهای پیچیده و چندمرحلهای را با بازدهی بسیار بالاتری انجام دهد.
پس این یعنی هوش مصنوعی عمومی رسیده؟
اوپنایآی و ARC Prize، سازندهٔ بنچمارک، اینجا دقیقاً همنظر نیستند. گرگ برکمن این مدل را «جهش نسلی» خواند و گفت ممکن است در آینده به آن به چشم شروع دوران AGI نگاه شود. اما ARC Prize، همانطور که خواندید، صراحتاً نوشته اشباعکردن این بنچمارک اثبات AGI نیست.
این تناقض بهخودیخود چیز بدی نیست؛ نشان میدهد که مسیر ارزیابی هوش مصنوعی هنوز باز است. آنچه واقعاً تغییر کرده، توانایی مدل در حفظ زمینه و برنامهریزی چندمرحلهای است — چیزی که در قابلیت «استفاده از کامپیوتر» هم دیده میشود. آنچه هنوز تغییر نکرده، فاصلهٔ بین حلکردن یک محیط بسته و ازپیشطراحیشده با کنارآمدن با دنیای واقعی، پر از استثنا و غافلگیری، است.
آیندهٔ این رقابت به کجا میرود؟
الگوی ARC-AGI خودش بهترین راهنمای آینده است. نسل اول این بنچمارک تا حد زیادی توسط مدلها حل شد، پس نسل دوم سختتر ساخته شد؛ حالا که نسل سوم هم — دستکم با هارنس اختصاصی — نزدیک به اشباع رسیده، بهاحتمال زیاد نسل چهارمی هم در راه است. این یعنی رقابت واقعی، رقابت بین قدرت مدلها و توانایی بنچمارکسازها برای طراحی آزمونهای سختتر است، نه یک خط پایان مشخص بهنام AGI.
نکتهٔ عملیتر برای هر کسی که این خبرها را دنبال میکند این است: بهجای تمرکز روی یک عدد تنها در یک اعلامیهٔ رسمی، باید پرسید آن عدد با چه هارنس و چه هزینهای بهدست آمده، و آیا در کاربردهای واقعی — نه فقط در یک محیط بسته و کنترلشده — هم تکرار میشود یا نه. قابلیت «استفاده از کامپیوتر» Astra دقیقاً نمونهای از همین چیز است که در ماههای آینده باید در گزارشهای کاربران واقعی دنبالش کرد، نه فقط در ویدیوهای تبلیغاتی روز عرضه.
شاید مسیر واقعی رسیدن هوش مصنوعی به سطح انسان، از دلِ یک اعلامیهٔ یکروزه با یک عدد بزرگ نگذرد؛ بلکه از دلِ همین اختلافهای کوچک بین آزمایشگاهها و ارزیابیکنندههای مستقل بگذرد، همانجایی که واقعاً معلوم میشود یک مدل چهچیزی را یاد گرفته و چهچیزی را هنوز نه.
این راهنما بخشی از مسیرهای عملی آموزش هوش مصنوعی در AIwithSaeed است.
دیدن مسیرهای یادگیری ←پرسشهای متداول
GPT-6 Astra چیست؟
GPT-6 Astra جدیدترین مدل اوپنایآی است که در ۳ سپتامبر ۲۰۲۶ معرفی شد. مهمترین قابلیت تازهاش «استفاده از کامپیوتر» است؛ یعنی میتواند صفحهنمایش را ببیند و مثل یک انسان با ماوس، صفحهکلید و برنامهها کار کند.
بنچمارک ARC-AGI-3 چه چیزی را میسنجد؟
ARC-AGI-3 هوش عاملمحور را در محیطهای نوبتی و کاملاً تازه میسنجد: کاوش، مدلسازی، هدفگذاری و برنامهریزی. برخلاف بیشتر بنچمارکها، مدل باید طی چند مرحله رفتارش را با چیزی که تازه یاد گرفته تطبیق دهد.
چرا Astra هم ۶۲.۷٪ و هم ۹۹.۹٪ گزارش شده؟
تفاوت در «هارنس» -- لایهٔ نرمافزاری اطراف مدل -- است، نه در خودِ مدل. هارنس استاندارد و خنثی ۶۲.۷٪ نتیجه داد؛ هارنس اختصاصی اوپنایآی که وضعیت استدلال داخلی را بین درخواستها حفظ میکند، ۹۹.۹٪ نتیجه داد.
آیا نمرهٔ ۹۹.۹٪ یعنی هوش مصنوعی عمومی (AGI) محقق شده؟
نه به گفتهٔ خودِ سازندگان بنچمارک. تیم ARC Prize صراحتاً نوشته اشباع این بنچمارک اثبات AGI نیست، چون محیطهای آزمون بسته و قطعیاند و پیچیدگی دنیای واقعی را ندارند.
همین الان میشود از GPT-6 Astra استفاده کرد؟
بله، از طریق API اوپنایآی با نرخ ۱۰ دلار برای هر میلیون توکن ورودی و ۵۰ دلار برای هر میلیون توکن خروجی؛ حدود ۲.۵ برابر نرخ تبلیغاتی مدل قبلی.
منابع و ارجاعات
- Introducing GPT-6 Astra - OpenAI
- OpenAI's GPT-6 Astra on ARC-AGI-3 - ARC Prize
- OpenAI releases new model GPT-6 Astra, says it may represent AGI - Axios
- OpenAI launches GPT-6 Astra, its most powerful model yet - Fortune
- Astra Scored 98.6% on ARC-AGI-3. NVIDIA Already Hit 100%. What Did Either Result Prove? - Kingy AI


