PRODUCTION NOTES · #01PROMPT & AGENTS
محظوظ ≠ مضبوط
نُشرت 1 دقائق قراءة
البرومبت اللي بيعطيك جواب ممتاز مرة وحدة… لسّا ما خلص. هو بس محظوظ.
خلّيني قلّك كيف بفرّق بين الحالتين.
تخيّل مصمم Senior: كل عرض بيعمله مختلف، بس كلهم صح وعلى الهوية. ما بتراجع وراه، لأنك واثق بطريقته.
نفس الشي بدي ياه من البرومبت والـAgent، وبختبرهم على مرحلتين:
- 01مضبوط (Tuned)نفس النموذج، مدخلات حقيقية، وبشغّله كذا مرة (مثلاً 20 مدخل × 5). إذا تقريباً 98% من النتائج طلعت متل المطلوب، فهو مضبوط. ما بقصد نفس الكلمات، بقصد نفس البنية والقرارات والجودة.
- 02محكم (Robust)بعدها بجرّبه على نموذج أصغر وأرخص. إذا ضل بين 85% و92%، فهو محكم. وإذا انهار؟ يعني النموذج الكبير كان عم يسدّ فراغات أنا ما كتبتها أصلاً.
ومش بس أنا بقول هيك:
- [1]اختبار τ-bench من Sierra بيشوف إذا الـAgent بينجح بكل محاولة، مش مرة وحدة. حتى GPT-4o نزل تحت 25% لما لازم ينجح بالـ8 كلهم.
- [2]وبحث بـICLR 2024: تغيير صغير بتنسيق البرومبت غيّر الدقة لحد 76 نقطة، واللي بيزبط مع نموذج مش شرط يزبط مع غيره.
وكمان بيوفّر مصاري: نقل الخطوات لنماذج أصغر كان من تلات أسباب نزّلت التكلفة 82% بالـAI pipeline اللي أنا مسؤول عنه.
شو بكتب بكل برومبت
- الدور: مين هو النموذج
- طريقة التفكير: كيف لازم يفكّر
- الحدود: شو ممنوع يعمل
- شكل الخرج: كيف لازم يطلع الجواب بالضبط
- الأمثلة: قوية بس خطيرة (النموذج بينسخها). أكتر بـ#03.
احكم على البرومبت من المرة المية، مش من أول مرة.