علاء البديوي

PRODUCTION NOTES · #01PROMPT & AGENTS

محظوظ ≠ مضبوط

نُشرت 1 دقائق قراءة

Read in Englishاقرأها على LinkedIn

البرومبت اللي بيعطيك جواب ممتاز مرة وحدة… لسّا ما خلص. هو بس محظوظ.

خلّيني قلّك كيف بفرّق بين الحالتين.

تخيّل مصمم Senior: كل عرض بيعمله مختلف، بس كلهم صح وعلى الهوية. ما بتراجع وراه، لأنك واثق بطريقته.

نفس الشي بدي ياه من البرومبت والـAgent، وبختبرهم على مرحلتين:

  1. 01مضبوط (Tuned)نفس النموذج، مدخلات حقيقية، وبشغّله كذا مرة (مثلاً 20 مدخل × 5). إذا تقريباً 98% من النتائج طلعت متل المطلوب، فهو مضبوط. ما بقصد نفس الكلمات، بقصد نفس البنية والقرارات والجودة.
  2. 02محكم (Robust)بعدها بجرّبه على نموذج أصغر وأرخص. إذا ضل بين 85% و92%، فهو محكم. وإذا انهار؟ يعني النموذج الكبير كان عم يسدّ فراغات أنا ما كتبتها أصلاً.

ومش بس أنا بقول هيك:

  1. [1]اختبار τ-bench من Sierra بيشوف إذا الـAgent بينجح بكل محاولة، مش مرة وحدة. حتى GPT-4o نزل تحت 25% لما لازم ينجح بالـ8 كلهم.
  2. [2]وبحث بـICLR 2024: تغيير صغير بتنسيق البرومبت غيّر الدقة لحد 76 نقطة، واللي بيزبط مع نموذج مش شرط يزبط مع غيره.

وكمان بيوفّر مصاري: نقل الخطوات لنماذج أصغر كان من تلات أسباب نزّلت التكلفة 82% بالـAI pipeline اللي أنا مسؤول عنه.

شو بكتب بكل برومبت

  • الدور: مين هو النموذج
  • طريقة التفكير: كيف لازم يفكّر
  • الحدود: شو ممنوع يعمل
  • شكل الخرج: كيف لازم يطلع الجواب بالضبط
  • الأمثلة: قوية بس خطيرة (النموذج بينسخها). أكتر بـ#03.
القاعدة اللي بشتغل فيها:
احكم على البرومبت من المرة المية، مش من أول مرة.

دورك

وإنت، إمتى بتعتبر البرومبت خلص؟

اقرأها على LinkedIn