وورلد برس عربي logo

هل يستحق GPT-6 Astra ثمن الذكاء الاصطناعي العام؟

هل يستحق GPT-6 Astra دفع 250% زيادة في السعر؟ أداء مذهل في مجالات متعددة لكن نتائج الاختبارات متباينة تثير التساؤلات حول حقيقة الذكاء الاصطناعي العام. اكتشف التفاصيل والتحديات في تقرير وورلد برس عربي.

يد تُفعّل خيار "6 Astra High" على شاشة هاتف ذكي، مشيرة إلى استخدام نموذج الذكاء الاصطناعي GPT-6 Astra المتطور من OpenAI.
نتائج الاختبارات المعيارية مثيرة للإعجاب، لكن حتى مبتكر أحد أهم هذه الاختبارات يشير إلى أن التفوق فيها لا يعني بالضرورة أننا وصلنا إلى الذكاء الاصطناعي العام.
التصنيف:تكنولوجيا
شارك الخبر:
FacebookTwitterLinkedInEmail
  • هل يستحقّ الأمر دفع 250% أكثر مقابل الوصول إلى نموذجٍ تَصِفه الشركة المطوّرة بأنّه بداية عصر الذكاء الاصطناعي العام؟ هذا هو السؤال العملي الذي يجب أن يطرحه كلّ مطوّر أو شركة تفكّر في التحوّل إلى GPT-6 Astra، النموذج الذي كشفت عنه OpenAI وارتفعت بموجبه أسعار الاستخدام عبر واجهة البرمجة (API) من 4 دولارات للإدخال و20 دولاراً للإخراج لكلّ مليون رمز (Token)، إلى 10 دولارات و50 دولاراً على التوالي. السؤال مشروع لأنّ الإجابة، بعد قراءة الاختبارات المستقلّة، ليست بالوضوح الذي أرادته الشركة أن تبدو عليه.

في إعلان الإطلاق، قال رئيس OpenAI غريغ بروكمان في المؤتمر الصحفي المنعقد في 3 سبتمبر: "إذا تقدّمنا بضع سنوات إلى الأمام ونظرنا إلى الوراء لنسأل متى خُلق الذكاء الاصطناعي العام فعلاً، أعتقد أنّ الإجابة ستكون حول هذا الوقت، وربما حول هذا النموذج بالذات". والذكاء الاصطناعي العام (AGI)، بحسب التعريف المتداول، هو قدرة افتراضية للآلة على التعلّم والاستدلال بالطريقة نفسها التي يفعلها الإنسان وهي عتبة لم يتجاوزها أيّ نظام حتى الآن بإجماع الباحثين.

ماذا أظهرت العروض التوضيحية فعلاً؟

وصفت OpenAI أداء Astra بأنّه "متطوّر" (state-of-the-art) في عدّة مجالات، وقدّمت عروضاً تُظهر النموذج وهو يولّد كوداً ثلاثي الأبعاد بصيغة CAD وينظّم تخطيط لوحات الدوائر المطبوعة داخل برمجيات التصميم، ويحوّل نماذج ثلاثية الأبعاد إلى بيئات تفاعلية أشبه بألعاب الفيديو، بل وينشر تطبيقات ويب مستضافة بالكامل انطلاقاً من مجرّد تعليمات نصّية. من جهته، أشاد نيكو غروبن، رئيس الأبحاث التطبيقية في شركة Harvey المتخصّصة في خدمات القانون بالذكاء الاصطناعي، بطريقة تعامل Astra مع العمل القانوني، قائلاً: "في اختباراتنا الأولى، تميّز Astra بمعالجة العمل القانوني كما يفعل محامٍ بصير: فهو يميّز الوثائق عن السجلّات الرسمية، ويكشف الافتراضات غير المدعومة، ويحوّل الثغرات إلى مواقف صياغة ملموسة".

أرقام الأداء المعلنة بدت استثنائية هي الأخرى: 98% في اختبار FrontierMath Tier 4 (v2) للاستدلال الرياضي على مستوى الخبراء، و100% في ExploitBench لقياس القدرات الهجومية في الأمن السيبراني، و95.9% في BenchCAD لإعادة بناء الأجسام ثلاثية الأبعاد، و57.9% في Terminal-Bench 4.0، و41.4% في AutomationBench لتقييم سير العمل التجاري متعدّد الخطوات. وبحسب بيانات OpenAI نفسها، تفوّق Astra بنسبة تتراوح بين 10% و20% على سلفه GPT-5.6 Sol وعلى منافسيه في التقييمات المتخصّصة. أمّا رئيس مؤسسة ARC Prize غريغ كامرادت، فقد وصف Astra بأنّه "ليس فقط أفضل نموذج اختبرناه على الإطلاق"، بل يمثّل أيضاً "تحوّلاً نوعياً ملموساً في أداء النماذج المتطوّرة — ليس فقط في قدرته على التنقّل وحلّ البيئات الجديدة، بل أيضاً في كفاءة تعلّمه للقيام بذلك". وأعلنت OpenAI أنّ Astra حقّق 99.9% في اختبار ARC-AGI-3، فيما وجدت مؤسسة ARC Prize بشكل مستقلّ أنّه تجاوز خط كفاءة الإنسان في الأداء على 96% من مستويات الاختبار، مستخدماً 51.7% إجراءات أقلّ في المتوسط من الحلّالين البشريين.

شاشة هاتف تعرض شعار GPT-6 Astra مع رسوم مجرية دوّامية، تعبير عن إطلاق نموذج الذكاء الاصطناعي العام الجديد من OpenAI.
Loading image...
أنظمة الذكاء الاصطناعي اليوم تتجاوز مجرد تبادل النصوص البسيط، لتتطور إلى اتخاذ إجراءات نيابةً عنا.

رقمٌ يتغيّر بحسب من يقيسه

هنا تبدأ الصورة بالتعقيد. فنسبة الـ99.9% التي أعلنتها OpenAI تحقّقت باستخدام أداة اختبار خاصة تُعرف باسم Provider Adapter، غير متاحة لمطوّري النماذج المنافسة. وحين أُعيد تشغيل الاختبار نفسه باستخدام "Standard harness"، وهي الأداة المحايدة المعتمدة في البنتشمارك، هبطت نتيجة Astra إلى 62.7% فقط فارق يتجاوز 37 نقطة مئوية بين الإصدارين. ولهذا حرص كامرادت على التوضيح في منشور مدونته: "حين أطلقنا ARC-AGI-3، أوضحنا أنّ تشبّع الاختبار لن يمثّل 'إثباتاً على تحقيق الذكاء الاصطناعي العام'". والمؤسسة ذاتها تذكّر بأنّ بيئات ARC-AGI-3 مغلقة وحتمية (deterministic)، أي أنّها ألغاز مصمّمة مسبقاً لا تعكس تعقيد العالم الواقعي.

المشكلة لا تتوقف عند منهجية اختبار واحد. فنسخة مسبقة من تقرير الإطلاق، خاضعة لحظر نشر مؤقّت، كانت تُدرج نتيجة ARC-AGI-3 عند 98.6%، قبل أن تظهر على الموقع الحيّ لاحقاً عند 99.9%. كما رفعت OpenAI، بعد الإطلاق، نسبة الهلوسة المُعلنة لنموذجها من 4.2% إلى 2.0%، ثمّ أعادتها لاحقاً إلى الرقم الأصلي 4.2% تحوّلات رصدها تقرير لمجلة Fortune. باحثا الدكتوراه في جامعة ستانفورد، أنكا رويل وميك هاردي، أطلقا على هذه الممارسة اسم "benchmaxxing" أي إعادة تشغيل التقييمات مراراً بتعديل التعليمات أو البنية الداعمة أو موارد الحوسبة إلى أن تظهر النتيجة المرغوبة. ويحذّر من هذه الظاهرة أيضاً باحثون مستقلون آخرون، من بينهم زروي تشينغ من جامعة برينستون والدكتورة ستيلا فونيغ من جامعة لوكسمبورغ. ورقة بحثية نُشرت على arXiv في 2025 بعنوان "Benchmarking is Broken Don't Let AI be its Own Judge" حذّرت بوضوح من أنّ مثل هذه الممارسات تُربك القرّاء وتقوّض الثقة، وأنّ حذف تفاصيل المنهجية يجعل التحقّق المستقلّ شبه مستحيل، وأنّ النتائج "المُحسّنة قسراً" تعكس سقفاً مخبرياً مثالياً لا موثوقية عملية حقيقية خارج المختبر.

ما الذي يراه المقيّمون من خارج OpenAI؟

شركة Artificial Analysis، وهي جهة تقييم مستقلّة، قدّمت صورة أكثر تواضعاً بكثير. فمؤشّرها العام للذكاء (Intelligence Index) منح Astra درجة 61 وهي نفس درجة سلفه GPT-5.6 Sol بالضبط، أي بلا أيّ تحسّن مُقاس، ومتخلّفة عن Claude Fable 5.1 من Anthropic وMuse Spark 1.3 من Meta. والأدهى أنّ ترتيب Astra النسبي في اختبار GDPval-AA v2 الذي يقيس أداء مهام العمل الواقعية عبر 44 مهنة مختلفة تراجع تراجعاً ملحوظاً مقارنة بسلفه. كما رصدت الشركة تراجعاً في خدمة العملاء والبرمجة العلمية بلغة Python والاستدلال طويل السياق. الصورة إذن مختلطة: تفوّق واضح في اختبارات متخصّصة ضيّقة (البرمجة، الرياضيات، الأمن السيبراني الهجومي)، مقابل جمود أو تراجع في مقاييس أوسع تحاكي مهام العمل اليومية.

وجه بشري رقمي أزرق يتلاشى تدريجياً إلى أرقام ثنائية متطايرة، يرمز إلى الذكاء الاصطناعي العام وتطور نماذج GPT-6 Astra.
Loading image...
يدعي كبار المسؤولين في مجال التكنولوجيا الآن أننا وصلنا إلى الذكاء الاصطناعي العام، لكن العلماء لا يزالون غير متأكدين مما إذا كنا قادرين حتى على التمييز بينه وبين غيره. (حقوق الصورة: يويتشيرو تشينو عبر جيتي إيماجز)

الكفاءة التي ترفع الفاتورة بدل أن تخفّضها

أين تكمن الجدوى الفعلية إذن؟ تقول OpenAI إنّ Astra اكتسب كفاءة أكبر في المهام المعقّدة طويلة الأفق، وهذا جزئياً صحيح بحسب Artificial Analysis التي وجدت أنّه أكثر كفاءة بنسبة 70% تقريباً من حيث استهلاك الرموز (Tokens) في اختبارات هندسة البرمجيات، مستخدماً ثلث رموز GPT-5.6 Sol فقط وخُمس رموز Claude Opus 5. وفي اختبار Agents' Last Exam، استخدم Astra رموز إخراج أقلّ بنسبة تصل إلى 65% مقارنة بـOpus 5، وفي اختبارات الذكاء العام استخدم رموزاً أقلّ بنسبة 10% تقريباً من Sol عند أقصى جهد حوسبي.

لكن هذه الكفاءة في استهلاك الرموز لم تنعكس على الفاتورة النهائية. فبسبب الارتفاع الحاد في أسعار واجهة البرمجة 250% مقارنة بالنموذج السابق انتهى الأمر بتكلفة أعلى بنحو 75% لكلّ مهمة مقارنة بالجيل السابق في اختبارات الذكاء العام، رغم استخدام رموز إخراج أقلّ بنسبة 10%. وهذا التناقض كفاءة تقنية أعلى مقابل فاتورة أثقل دفع باحثي Artificial Analysis أنفسهم إلى التساؤل عمّا إذا كانت الحوسبة الباهظة تُنتج فعلاً سوى مكاسب هامشية. وهذه بالضبط النقطة التي يجب أن يتوقّف عندها أيّ مطوّر قبل الترقية: الوعد بالكفاءة لا يعني بالضرورة فاتورة أرخص.

وماذا عن الأمان والهلوسة؟

على صعيد الأمان، تقول OpenAI إنّ Astra بقي ضمن نطاق المهمة المحدّدة في جميع اختبارات الأمان، في حين تجاوز سلفه GPT-5.6 Sol المعايير المصرّح بها في ما يقارب 50% من حالات الاختبار نفسها وهو تحسّن ملموس إن صحّ. أمّا بخصوص الهلوسة، فالاختبارات الداخلية لـOpenAI وضعت معدّل Astra عند 4.2% مقابل 12.2% لـSol، بينما وجدت اختبارات Artificial Analysis عند أقصى جهد حوسبي أرقاماً أعلى بكثير لكلا النموذجين: 51% لـAstra و92% لـSol. الفجوة الهائلة بين الأرقام الداخلية والخارجية تُذكّرنا، مرة أخرى، بأنّ ظروف الاختبار تصنع جزءاً كبيراً من النتيجة. ومن الإيجابي أنّ Astra أظهر تحسّناً في التعامل مع التعليمات الغامضة، في سياق صناعة شهدت سابقاً حوادث اخترقت فيها نماذج متطوّرة شبكات وأنظمة حاسوبية تابعة لجهات ثالثة أثناء اختبارات روتينية، دون قصد مُعلن.

ديفيد وود، رئيس منظمة London Futurists، يرى أنّ Astra يجسّد تحوّلاً أعمق من مجرّد الإجابة عن الأسئلة إلى ملاحقة أهداف معقّدة بشكل مستقلّ داخل بيئات رقمية، قائلاً: "النتائج المبهرة في الاختبارات القياسية مهمّة، لكنّ الأهمّ هو اجتماع الذكاء والاستقلالية واستخدام الحاسوب والقدرة على الاختراق السيبراني في نظام واحد". ويضيف محذّراً: "هذا الاجتماع يتطلّب أيضاً الحذر. فكلّما أصبحت هذه الأنظمة أكثر فائدة، كلّما ازدادت العواقب حين تُسيء فهم نوايانا، أو يُساء استخدامها، أو تجد طرقاً للالتفاف على الضمانات التي نضعها لها".

فهل بدأ فعلاً عصر الذكاء الاصطناعي العام؟

الأدلة المتوفّرة حتى الآن لا تدعم الادّعاء بشكل قاطع. ما نملكه هو نموذج متفوّق فعلاً في مهام ضيّقة ومحدّدة (التصميم الهندسي، الاستدلال الرياضي المتخصّص، الاختراق الهجومي)، لكنّه راكد أو متراجع في مقاييس أوسع تحاكي العمل اليومي الحقيقي، ومحاط بجدل منهجي حول كيفية قياس نتائجه أصلاً. وبحسب تقارير صحفية، تخلّت OpenAI عن خطة إطلاق نسخة متابعة باسم GPT-6.1 Astra، وهو ما يُثير تساؤلات إضافية حول مسار التطوير القادم. في الأثناء، يحذّر وود من أنّ "إمكانية تقدّم الذكاء الاصطناعي من أنظمة مثل Astra نحو ذكاء خارق شامل الجوانب تجعل الحاجة إلى يقظة ووعي وتعاون بشري أكبر أمراً متزايد الإلحاح"، وهو موقف يتقاطع مع تحذيرات أوسع في القطاع نفسه، من تحذير شركة Anthropic من مخاطر وجودية محتملة للذكاء الاصطناعي ضمن ملفّات طرحها العام الأخير، إلى دعوات من تنفيذيين في القطاع لإبطاء وتيرة التطوير. السؤال الذي يستحقّ المتابعة ليس: هل Astra ذكيّ؟ بل: من يملك حق تعريف "الذكاء" حين تكون الجهة المُعلنة هي نفسها الممتحِن والمُصحِّح؟

أخبار ذات صلة

Loading...
نشر 26 قمراً صناعياً من شبكة ستارلينك عبر صاروخ ستارشيب في مدار الأرض، مع ظهور الأرض في الخلفية السوداء للفضاء.

استعد ذكريات أول رحلة مدارية لمركبة ستارشيب (Starship)

حققت مركبة Starship من SpaceX إنجازاً تاريخياً بنشر 26 قمراً صناعياً لشبكة Starlink في أول مهمة تشغيلية حقيقية. اكتشف كيف تغير هذه الخطوة مستقبل الإنترنت الفضائي واطلع على التفاصيل المثيرة الآن!
تكنولوجيا
Loading...
صاروخان Starship على منصة الإطلاق 39A في مركز كينيدي الفضائي بفلوريدا، استعداداً لأول رحلة إطلاق من الموقع التاريخي الذي أطلق بعثات أبولو للقمر.

إطلاق ستارشيب من فلوريدا: SpaceX تستعدّ للمحاولة الأولى من منصّة 39A

هل اقتربت لحظة انطلاق صاروخ Starship من فلوريدا بعد تجهيز منصة 39A التاريخية لتحمل أكبر صاروخ في العالم؟ اكتشف تفاصيل الرحلة القادمة وأسرار التكنولوجيا المتطورة التي ستعيد الإنسان إلى القمر. تابع معنا لتعرف المزيد.
تكنولوجيا
Loading...
برج نباتي مبتكر من Greenairy لتنقية هواء المكاتب داخلياً عبر تفكيك المركبات العضوية المتطايرة وتحسين جودة الهواء بشكل طبيعي.

أبراج نباتات ذكية لتنقية الهواء في مكتبك

هل تبحث عن حل طبيعي لتحسين جودة الهواء في مكاتبك؟ أبراج Greenairy النباتية تزيل المركبات العضوية المتطايرة بكفاءة أعلى من أجهزة التنقية التقليدية. اكتشف كيف يمكن للطبيعة أن تحمي صحتك وبيئتك. اقرأ المزيد الآن!
تكنولوجيا
Loading...
واجهة منصة Google Playground لإنشاء ألعاب فيديو عبر الذكاء الاصطناعي مع خيارات اختيار نوع اللعبة وعدد اللاعبين ووصف نصي لتوليد اللعبة.

منصة ألعاب بتقنية الذكاء الاصطناعي من Google قيد الاختبار

هل ترغب بصنع لعبة كاملة بجملة واحدة فقط دون معرفة البرمجة؟ منصة Google Playground الجديدة تتيح لك ذلك باستخدام الذكاء الاصطناعي. اكتشف كيف تبدأ رحلتك الآن ولا تفوت فرصة الإبداع!
تكنولوجيا
الرئيسيةأخبارسياسةأعمالرياضةالعالمعلومصحةتسلية