در ادامه پروسه‌های باگ یابی من از شرکتهای هوش مصنوعی. الان متوجه شدم… — دستاوردهای یادگیری عمیق(InTec) — TG.ME

Forwarded fromRARandRng
در ادامه پروسه‌های باگ یابی من از شرکتهای هوش مصنوعی.

الان متوجه شدم چرا خیلی از بچه‌ها میگن که فقط با Claude می‌تونند کد بزنند؛ من یک باگ جدید پیدا کردم.
Qwen, Grok, ChatGpt, GLM5.2
رو تست کردم؛ این مدل‌های پارسر ضعیفتری دارند.

اول اینکه بنظر میاد همشون کد رو هم مثل markdown باهاش برخورد می‌کنند و پارس می‌کنند چرا ؟
حجم زیادی کد بهشون دادم با پرامپت سختگیرانه (خیلی بی‌ادبی هست وگرنه میذاشتم) و همشون چون رو حالت سخت گیری هست ارورهای پارسر رو نادیده نمی‌گیرند.
این نادیده گرفتن یک تکنیکی هست که ما هم توی پروداکشن استفاده می‌کنیم؛ اینطوری هست که اگر ببینید طرف راجب چیزی صحبت می‌کنه که به اندازه کافی علم داره ازش به مدل میگیم بعضی خطاها ممکنه اشتباه پارسر یا سرویس OCR باشه و نادیده‌اش بگیر.
ولی اینجا مدل‌های بالا با پرامپتی که من دادم دیگه اینطوری نشد و کلی ایراد الکی گرفتند.

بعنوان مثال :
Bug 1: __main__.py entrypoint is broken
You have:

if name == "main":
main()


That is wrong.
It must be:

if __name__ == "__main__":
main()


بدتر از اون اینکه بعضی مدل‌ها حتی اینطوری می‌بیننش :

if name



من تمام مدل‌هایی که اسم بردم رو توی ۳ حالت استفاده کردم :

۱- با پرامپت سختگیرانه که بالاتر گفتم
۲- پرامپت ساده که فقط یک role بهش دادم (این مشکلات وجود نداشت)‌
۳-پرامپت سختگیرانه +‌ استفاده از محیط چت و کپی پیست کد بعد از توضیح اینکه مطلب ارسالی کد پایتون هست.

و بهترین جواب رو حالت سوم داد؛‌ اگر به اندازه کافی کانال رو دنبال کرده باشید می‌دونید که من اصلا به هیچ ابزار و agent ایی که دسترسی به سیستمم داشته باشه اعتماد ندارم و همیشه از محیط‌های چت مرورگر استفاده می‌کنم و کدهام رو اونجا بهشون میدم.

با دیدن این نتابج الان میفهمم چرا برای خیلی از شما سوال میشه که من چطوری از
Qwen, Duck.ai , ...
استفاده می‌کنم و انقدر از خروجی‌هاش راضی هستم.
بنظرم شما هم این رو تست کنید- من فقط روی ۴ مدلی که اسم بردم تست کردم.
👍13❤10
August 2, 2026 3.9K 28