تقریبا می‌تونم بگم تمام بنچمارک‌های معروف هوش مصنوعی از رده خارج شده… — دستاوردهای یادگیری عمیق(InTec) — TG.ME

Forwarded fromRARandRng
تقریبا می‌تونم بگم تمام بنچمارک‌های معروف هوش مصنوعی از رده خارج شده حساب میشه مثلا توی یکی از موارد

Artificial Analysis

رسما (توییتر) قبول کرد که بنچمارک‌هاش قدیمی شده و اکثر مواردی که داره مربوط به چالش بسیار قدیمی
needle in haystack

هست یا مواردی توی بنچمارک‌های software engineering هم من گزارشاتی خوندم که بیشتر تسک‌هاشون برای
Frontend, 3D

و پیشرفت‌های اخیر مدل‌ها رو ببینید؛‌ اکثرا دارند توی Game development, Frontend و ... تست میشوند روی یوتیوب و همه‌ی اون‌هایی که توی این تسک‌ها نتایج خوبی داشتند توی بنچمارک‌های معروف هم بسیار خوب عمل‌ می‌کنند.


توی همون تسک خوندن لاگ و پیدا کردن مشکل مجبور شدم یک سری کد بزنم که کارم رو سریعتر کنم
https://t.me/per3onnel/629

شاید باورتون نشه ولی
gemini 3.6 Flash (Fast)
بهترین نتایج رو بهم میداد

من همیشه مدل‌ها رو با کدهای خودم تست می‌کنم الان چندسال هست و بنظرم توی زمان حال شما هم باید همین کار رو انجام بدید؛ خیلی از مدل‌هایی که از نظر بنچمارک‌ها rank بالا می‌گیرند ممکنه برای کار شما اصلا مناسب نباشه و برعکس این موضوع هم هست.

چطوری بنچمارک خودتون رو بسازید (من اینطوری ساختم) :
یک کد یا تسک یا کانفیگ دارم که مشکل داره و درست کار نمی‌کنه به مدل‌های هوش مصنوعی موجود میدم و جواب‌ها رو بررسی می‌کنم ولی هیچکدوم جواب درست رو نمیده
این رو ذخیره میکنم کد/کانفیگ اشتباه رو + پرامپت رو بعنوان ورودی برای تست ذخیره می‌کنم.

وقتی بعد از چندساعت به راه حل رسیدم اون راه حل رو هم ذخیره می‌کنم (خلاصه شده و تمیز شده فقط راه حل رو بدون توضیحات)

چندماه بعد که مدل جدیدی معرفی میشه همین کار رو تکرار می‌کنم؛ امتیاز مدل رو می‌نویسم :‌
مثلا از ۳۰ تا سوال چندتارو درست جواب داده - جندتا رو جوابی که داده راهنمای خوبی برای رسیدن به راه حل و درک مشکل هست ولی جواب نهاییش درست نیست - چندتارو کاملا گمراه کننده جواب داده

و اینکه برای هیچ مدلی پرامپت ورودی رو تغییر نمیدم؛ این استاندارد پرامپت نویسی منه شاید مدل خیلی خفن باشه ولی اگر پرامپت ذخیره شده من نتونه ازش جواب بگیره احتمال اینکه موقع استفاده من بتونم از اون مدل جواب بگیرم هم خیلی پایین هست (چون من به این تکنیک پرامپت نوشتن عادت کردم)


اینکار رو بنظرم هرکسی که بیش از روزانه ۱ ساعت از LLM برای کد نویسی یا حل مشکلات فنی استفاده می‌کنه باید انجام بده؛ بخصوص اینکه ۹۰٪ یوتیوبرها برای بنچمارک دارند از تسک‌های دارای گرافیک استفاده می‌کنند چون بازدید این‌ها بیشتر هست.
من یوتیوبری رو نمیشناسم که مثلا بیاد پیاده‌سازی یک سرویس بکند (جدید نه چیزی که هزاران کد براش توی گیت‌هاب هست) یا پیاده سازی driver یا embed system رو تست کنه چون این موارد بازدید نداره ولی احتمالا شغل اکثر شمایی که عضو این کانال هستید به این موارد بستگی داره.

برای خودم واقعا شکه کننده بود که
gemini 3.6 flash (fast)
تمام کدهایی که ازش میخواستم روی توی همون بار اول درست تحویل میداد (البته من خیلی می‌شکوندم تسک رو و با جزئیات بهش می‌گفتم چطوری باید باشه) ولی این مدل حتی توی ۳۰ مدل اول DeepSWE هم نیست و انقدر هم سریع خروجی بهتون میده که سرعت برنامه‌نویسی شما رو اصلا کم نمی‌کنه.
تنها مشکلی که من دیدم:
توی پروژه بزرگتر حتما باید خودتون بعدش refactor کنید.
Telegram
RandRng
بیش از ۱ سال پیش با یک شرکتی یک قرارداد همکاری موقت نوشتیم (بعدش به همکاری طولانی نرسید هرچند من خیلی دوس داشتم که برسه)‌ توی همون مدت من بسیاری از pipeline داده و دپلوی و سرورها رو طبق تغییراتی که روی کدها همراه با تیم اعمال کردیم تغییر دادم؛ چون نیروی DevOps…
👍13❤4
September 10, 2026 1.5K 27