→ بازگشت به مجله
اخبار و فناوری هوش مصنوعی

GPT-6 Astra و بنچمارک ARC-AGI-3: عدد ۹۹.۹٪ چه چیزی را واقعاً نشان می‌دهد؟

اوپن‌ای‌آی می‌گوید GPT-6 Astra بنچمارک ARC-AGI-3 را با ۹۹.۹٪ اشباع کرده؛ اما همین مدل با روش استاندارد اندازه‌گیری فقط ۶۲.۷٪ گرفته. بررسی دقیق اینکه این فاصله از کجا می‌آید و چه معنایی دارد.

در این ویدیوی رسمی، اوپن‌ای‌آی مدل تازه‌اش GPT-6 Astra را به‌عنوان «هوشمندترین و همسوترین» مدلی که تا امروز ساخته، معرفی می‌کند و روی قابلیت تازهٔ «استفاده از کامپیوتر» تمرکز دارد؛ یعنی مدلی که می‌تواند مثل یک انسان با صفحه‌نمایش، برنامه‌ها و مرورگر کار کند.

گفتار ویدیو انگلیسی است، اما زیرنویس فارسی دارد. روی چرخ‌دنده ⚙️ بزنید، بعد زیرنویس، سپس ترجمه خودکار و از فهرست فارسی را انتخاب کنید.
ویدیوی رسمی معرفی — کانال OpenAI، ۳ سپتامبر ۲۰۲۶.

اوپن‌ای‌آی در ۳ سپتامبر ۲۰۲۶ از GPT-6 Astra رونمایی کرد و در همان اعلامیه نوشت این مدل بنچمارک ARC-AGI-3 را با نمرهٔ ۹۹.۹٪ «اشباع» کرده است؛ عددی که در چند ساعت به تیتر اول رسانه‌های فناوری تبدیل شد. اما همان روز، خودِ سازندگان این بنچمارک یعنی تیم ARC Prize یک نکتهٔ کلیدی را هم منتشر کردند: همین مدل، با تنظیمات اندازه‌گیری متفاوت، عدد ۶۲.۷٪ هم گرفته است. این مقاله دقیقاً همین فاصله را بررسی می‌کند: مدل چه تغییری کرده، بنچمارک چه چیزی را واقعاً می‌سنجد، و چرا یک مدل واحد دو نمرهٔ این‌قدر متفاوت گرفته است.

شرکتOpenAI
معرفی شد۳ سپتامبر ۲۰۲۶
قیمت API۱۰ تا ۵۰ دلار / میلیون توکن
قابلیت تازهاستفاده از کامپیوتر

چه‌چیزی در Astra واقعاً تازه است؟

مهم‌ترین قابلیت تازهٔ Astra چیزی است که اوپن‌ای‌آی آن را استفاده از کامپیوتر (Computer Use) می‌نامد: مدل می‌تواند صفحه‌نمایش را ببیند، ماوس و صفحه‌کلید را کنترل کند و کارهایی مثل پرکردن یک فرم، ساخت یک فایل سه‌بعدی در نرم‌افزار Blender یا ثبت یک آگهی روی eBay را مستقیماً از روی یک دستور صوتی انجام دهد؛ بدون اینکه کاربر مرحله‌به‌مرحله راهنمایی‌اش کند.

گرگ برکمن، رئیس اوپن‌ای‌آی، این مدل را یک «جهش نسلی» توصیف کرد و گفت شاید در آینده به آن به‌عنوان نقطهٔ شروع هوش مصنوعی عمومی (AGI) نگاه شود؛ ادعایی بزرگ که در ادامهٔ همین مقاله آن را کنار حرف خودِ سازندگان بنچمارک می‌گذاریم.

نکتهٔ کمتر گفته‌شده این است که این عرضه با تأخیر همراه بود. اوپن‌ای‌آی پس از یک حادثهٔ امنیتی در تیر ۱۴۰۵ (ژوئیهٔ ۲۰۲۶) روی پلتفرم Hugging Face، عرضهٔ مدل بعدی‌اش را عقب انداخت تا لایه‌های ایمنی بیشتری اضافه کند. قیمت Astra هم در سطح API حدود ۲.۵ برابر نرخ تبلیغاتی مدل قبلی، GPT-5.6 Sol، است؛ ۱۰ دلار برای هر میلیون توکن ورودی و ۵۰ دلار برای هر میلیون توکن خروجی.

بنچمارک ARC-AGI-3 چیست؟

ARC-AGI-3 برای سنجش چیزی طراحی شده که به آن هوش عامل‌محور (Agentic Intelligence) می‌گویند: توانایی یک مدل برای کاوش در یک محیط کاملاً تازه، فهمیدن قوانین آن بدون راهنمای از‌قبل‌نوشته‌شده، و رسیدن به یک هدف با آزمون‌وخطای هوشمندانه. برخلاف بیشتر بنچمارک‌های رایج که یک‌بار سؤال می‌پرسند و یک‌بار جواب می‌گیرند، محیط‌های ARC-AGI-3 نوبتی و انتزاعی‌اند؛ یعنی مدل باید طی چند مرحله، رفتارش را بر اساس چیزی که تازه یاد گرفته، تغییر دهد.

این بنچمارک چهار توانایی را جدا از هم می‌سنجد: کاوش یعنی به‌دست‌آوردن فعالانهٔ اطلاعات به‌جای منتظرماندن، مدل‌سازی یعنی تبدیل مشاهدات به یک پیش‌بینی قابل‌تعمیم، هدف‌گذاری یعنی پیداکردن وضعیت مطلوب با پاداش‌های کم و پراکنده، و برنامه‌ریزی و اجرا یعنی طراحی مسیر رسیدن به هدف و اصلاح آن در حین کار.

دلیل وجود نسل سوم این بنچمارک هم خودش گویاست: نسل اول و دوم ARC-AGI پیش‌تر تا حد زیادی توسط مدل‌های پیشرفته «اشباع» شده بودند، یعنی مدل‌ها یاد گرفته بودند آن‌ها را حل کنند. این یک الگوی تکرارشونده است؛ هر نسل بنچمارک تا وقتی مدل‌ها به آن عادت نکرده‌اند سخت به‌نظر می‌رسد، و هر بار طراحان مجبورند نسخهٔ سخت‌تری بسازند.

عدد ۹۹.۹٪ در برابر ۶۲.۷٪: ماجرا از چه قرار است؟

اینجا بخش اصلی ماجراست. Astra روی همان مجموعهٔ آزمون ARC-AGI-3، دو نمرهٔ کاملاً متفاوت گرفته و تفاوت، نه در خودِ مدل، بلکه در چیزی است که ARC Prize آن را هارنس (Harness) می‌نامد؛ یعنی لایهٔ نرم‌افزاری اطراف مدل که تعیین می‌کند مدل چطور با محیط تعامل کند و چه‌چیزی را بین مراحل مختلف به‌خاطر بسپارد.

با هارنس استاندارد — یک رابط خنثی و یکسان برای همهٔ شرکت‌ها، که مقایسهٔ منصفانهٔ مدل‌های مختلف را ممکن می‌کند — Astra نمرهٔ ۶۲.۷٪ گرفت؛ با هزینهٔ نزدیک به ۲۶ هزار دلار محاسبات. اما با هارنس اختصاصی اوپن‌ای‌آی (Provider Adapter) که به مدل اجازه می‌دهد وضعیت استدلال داخلی‌اش را بین درخواست‌های مختلف حفظ کند و گفت‌وگوهای طولانی را فشرده‌سازی کند، همان مدل به ۹۹.۹٪ رسید؛ این‌بار با حدود ۱۹ هزار دلار محاسبات، یعنی حتی ارزان‌تر.

اشباع این بنچمارک به معنای اثبات رسیدن به هوش مصنوعی عمومی نیست.

این جمله را خودِ تیم ARC Prize، سازندهٔ بنچمارک، در تحلیل رسمی‌شان دربارهٔ نتیجهٔ Astra نوشتند. آن‌ها تأکید کردند که ARC-AGI-3 هرچند نشان‌دهندهٔ «پیشرفت واقعی به‌سمت تعمیم‌پذیری» است، اما دامنه‌اش محدود و از پیش تعیین‌شده است؛ مکانیک‌های آن قطعی و بسته‌اند، برخلاف پیچیدگی و عدم‌قطعیت دنیای واقعی. به زبان ساده: عدد ۹۹.۹٪ واقعی است، اما دقیقاً همان چیزی نیست که بیشتر مردم با شنیدنش تصور می‌کنند.

این ویدیوی رسمی برای برنامه‌نویسان است و دقیقاً همان تفاوت را از زاویهٔ فنی نشان می‌دهد: چطور حفظ‌کردن وضعیت استدلال بین درخواست‌ها (Reasoning State) و فشرده‌سازی مکالمه‌های طولانی، به مدل اجازه می‌دهد کارهای پیچیده و چندمرحله‌ای را با بازدهی بسیار بالاتری انجام دهد.

کانال OpenAI، سپتامبر ۲۰۲۶.

پس این یعنی هوش مصنوعی عمومی رسیده؟

اوپن‌ای‌آی و ARC Prize، سازندهٔ بنچمارک، اینجا دقیقاً هم‌نظر نیستند. گرگ برکمن این مدل را «جهش نسلی» خواند و گفت ممکن است در آینده به آن به چشم شروع دوران AGI نگاه شود. اما ARC Prize، همان‌طور که خواندید، صراحتاً نوشته اشباع‌کردن این بنچمارک اثبات AGI نیست.

این تناقض به‌خودی‌خود چیز بدی نیست؛ نشان می‌دهد که مسیر ارزیابی هوش مصنوعی هنوز باز است. آنچه واقعاً تغییر کرده، توانایی مدل در حفظ زمینه و برنامه‌ریزی چندمرحله‌ای است — چیزی که در قابلیت «استفاده از کامپیوتر» هم دیده می‌شود. آنچه هنوز تغییر نکرده، فاصلهٔ بین حل‌کردن یک محیط بسته و از‌پیش‌طراحی‌شده با کنارآمدن با دنیای واقعی، پر از استثنا و غافلگیری، است.

آیندهٔ این رقابت به کجا می‌رود؟

الگوی ARC-AGI خودش بهترین راهنمای آینده است. نسل اول این بنچمارک تا حد زیادی توسط مدل‌ها حل شد، پس نسل دوم سخت‌تر ساخته شد؛ حالا که نسل سوم هم — دست‌کم با هارنس اختصاصی — نزدیک به اشباع رسیده، به‌احتمال زیاد نسل چهارمی هم در راه است. این یعنی رقابت واقعی، رقابت بین قدرت مدل‌ها و توانایی بنچمارک‌سازها برای طراحی آزمون‌های سخت‌تر است، نه یک خط پایان مشخص به‌نام AGI.

نکتهٔ عملی‌تر برای هر کسی که این خبرها را دنبال می‌کند این است: به‌جای تمرکز روی یک عدد تنها در یک اعلامیهٔ رسمی، باید پرسید آن عدد با چه هارنس و چه هزینه‌ای به‌دست آمده، و آیا در کاربردهای واقعی — نه فقط در یک محیط بسته و کنترل‌شده — هم تکرار می‌شود یا نه. قابلیت «استفاده از کامپیوتر» Astra دقیقاً نمونه‌ای از همین چیز است که در ماه‌های آینده باید در گزارش‌های کاربران واقعی دنبالش کرد، نه فقط در ویدیوهای تبلیغاتی روز عرضه.

شاید مسیر واقعی رسیدن هوش مصنوعی به سطح انسان، از دلِ یک اعلامیهٔ یک‌روزه با یک عدد بزرگ نگذرد؛ بلکه از دلِ همین اختلاف‌های کوچک بین آزمایشگاه‌ها و ارزیابی‌کننده‌های مستقل بگذرد، همان‌جایی که واقعاً معلوم می‌شود یک مدل چه‌چیزی را یاد گرفته و چه‌چیزی را هنوز نه.

مسیر یادگیری بعدی

این راهنما بخشی از مسیرهای عملی آموزش هوش مصنوعی در AIwithSaeed است.

دیدن مسیرهای یادگیری ←

پرسش‌های متداول

GPT-6 Astra چیست؟

GPT-6 Astra جدیدترین مدل اوپن‌ای‌آی است که در ۳ سپتامبر ۲۰۲۶ معرفی شد. مهم‌ترین قابلیت تازه‌اش «استفاده از کامپیوتر» است؛ یعنی می‌تواند صفحه‌نمایش را ببیند و مثل یک انسان با ماوس، صفحه‌کلید و برنامه‌ها کار کند.

بنچمارک ARC-AGI-3 چه چیزی را می‌سنجد؟

ARC-AGI-3 هوش عامل‌محور را در محیط‌های نوبتی و کاملاً تازه می‌سنجد: کاوش، مدل‌سازی، هدف‌گذاری و برنامه‌ریزی. برخلاف بیشتر بنچمارک‌ها، مدل باید طی چند مرحله رفتارش را با چیزی که تازه یاد گرفته تطبیق دهد.

چرا Astra هم ۶۲.۷٪ و هم ۹۹.۹٪ گزارش شده؟

تفاوت در «هارنس» -- لایهٔ نرم‌افزاری اطراف مدل -- است، نه در خودِ مدل. هارنس استاندارد و خنثی ۶۲.۷٪ نتیجه داد؛ هارنس اختصاصی اوپن‌ای‌آی که وضعیت استدلال داخلی را بین درخواست‌ها حفظ می‌کند، ۹۹.۹٪ نتیجه داد.

آیا نمرهٔ ۹۹.۹٪ یعنی هوش مصنوعی عمومی (AGI) محقق شده؟

نه به گفتهٔ خودِ سازندگان بنچمارک. تیم ARC Prize صراحتاً نوشته اشباع این بنچمارک اثبات AGI نیست، چون محیط‌های آزمون بسته و قطعی‌اند و پیچیدگی دنیای واقعی را ندارند.

همین الان می‌شود از GPT-6 Astra استفاده کرد؟

بله، از طریق API اوپن‌ای‌آی با نرخ ۱۰ دلار برای هر میلیون توکن ورودی و ۵۰ دلار برای هر میلیون توکن خروجی؛ حدود ۲.۵ برابر نرخ تبلیغاتی مدل قبلی.

منابع و ارجاعات

  1. Introducing GPT-6 Astra - OpenAI
  2. OpenAI's GPT-6 Astra on ARC-AGI-3 - ARC Prize
  3. OpenAI releases new model GPT-6 Astra, says it may represent AGI - Axios
  4. OpenAI launches GPT-6 Astra, its most powerful model yet - Fortune
  5. Astra Scored 98.6% on ARC-AGI-3. NVIDIA Already Hit 100%. What Did Either Result Prove? - Kingy AI
ادامه یادگیری

مطلب‌های بعدی