Artificial Analysisرسما (توییتر) قبول کرد که بنچمارکهاش قدیمی شده و اکثر مواردی که داره مربوط به چالش بسیار قدیمی
needle in haystackهست یا مواردی توی بنچمارکهای
software engineering هم من گزارشاتی خوندم که بیشتر تسکهاشون برای Frontend, 3Dو پیشرفتهای اخیر مدلها رو ببینید؛ اکثرا دارند توی
Game development, Frontend و ... تست میشوند روی یوتیوب و همهی اونهایی که توی این تسکها نتایج خوبی داشتند توی بنچمارکهای معروف هم بسیار خوب عمل میکنند.توی همون تسک خوندن لاگ و پیدا کردن مشکل مجبور شدم یک سری کد بزنم که کارم رو سریعتر کنم
https://t.me/per3onnel/629
شاید باورتون نشه ولی
gemini 3.6 Flash (Fast) بهترین نتایج رو بهم میداد
من همیشه مدلها رو با کدهای خودم تست میکنم الان چندسال هست و بنظرم توی زمان حال شما هم باید همین کار رو انجام بدید؛ خیلی از مدلهایی که از نظر بنچمارکها
rank بالا میگیرند ممکنه برای کار شما اصلا مناسب نباشه و برعکس این موضوع هم هست.چطوری بنچمارک خودتون رو بسازید (من اینطوری ساختم) :
یک کد یا تسک یا کانفیگ دارم که مشکل داره و درست کار نمیکنه به مدلهای هوش مصنوعی موجود میدم و جوابها رو بررسی میکنم ولی هیچکدوم جواب درست رو نمیده
این رو ذخیره میکنم کد/کانفیگ اشتباه رو + پرامپت رو بعنوان ورودی برای تست ذخیره میکنم.
وقتی بعد از چندساعت به راه حل رسیدم اون راه حل رو هم ذخیره میکنم (خلاصه شده و تمیز شده فقط راه حل رو بدون توضیحات)
چندماه بعد که مدل جدیدی معرفی میشه همین کار رو تکرار میکنم؛ امتیاز مدل رو مینویسم :
مثلا از ۳۰ تا سوال چندتارو درست جواب داده - جندتا رو جوابی که داده راهنمای خوبی برای رسیدن به راه حل و درک مشکل هست ولی جواب نهاییش درست نیست - چندتارو کاملا گمراه کننده جواب داده
و اینکه برای هیچ مدلی پرامپت ورودی رو تغییر نمیدم؛ این استاندارد پرامپت نویسی منه شاید مدل خیلی خفن باشه ولی اگر پرامپت ذخیره شده من نتونه ازش جواب بگیره احتمال اینکه موقع استفاده من بتونم از اون مدل جواب بگیرم هم خیلی پایین هست (چون من به این تکنیک پرامپت نوشتن عادت کردم)
اینکار رو بنظرم هرکسی که بیش از روزانه ۱ ساعت از
LLM برای کد نویسی یا حل مشکلات فنی استفاده میکنه باید انجام بده؛ بخصوص اینکه ۹۰٪ یوتیوبرها برای بنچمارک دارند از تسکهای دارای گرافیک استفاده میکنند چون بازدید اینها بیشتر هست.من یوتیوبری رو نمیشناسم که مثلا بیاد پیادهسازی یک سرویس بکند (جدید نه چیزی که هزاران کد براش توی گیتهاب هست) یا پیاده سازی
driver یا embed system رو تست کنه چون این موارد بازدید نداره ولی احتمالا شغل اکثر شمایی که عضو این کانال هستید به این موارد بستگی داره.برای خودم واقعا شکه کننده بود که
gemini 3.6 flash (fast) تمام کدهایی که ازش میخواستم روی توی همون بار اول درست تحویل میداد (البته من خیلی میشکوندم تسک رو و با جزئیات بهش میگفتم چطوری باید باشه) ولی این مدل حتی توی ۳۰ مدل اول
DeepSWE هم نیست و انقدر هم سریع خروجی بهتون میده که سرعت برنامهنویسی شما رو اصلا کم نمیکنه.تنها مشکلی که من دیدم:
توی پروژه بزرگتر حتما باید خودتون بعدش
refactor کنید.
