الان متوجه شدم چرا خیلی از بچهها میگن که فقط با
Claude میتونند کد بزنند؛ من یک باگ جدید پیدا کردم.Qwen, Grok, ChatGpt, GLM5.2 رو تست کردم؛ این مدلهای پارسر ضعیفتری دارند.
اول اینکه بنظر میاد همشون کد رو هم مثل
markdown باهاش برخورد میکنند و پارس میکنند چرا ؟حجم زیادی کد بهشون دادم با پرامپت سختگیرانه (خیلی بیادبی هست وگرنه میذاشتم) و همشون چون رو حالت سخت گیری هست ارورهای پارسر رو نادیده نمیگیرند.
این نادیده گرفتن یک تکنیکی هست که ما هم توی پروداکشن استفاده میکنیم؛ اینطوری هست که اگر ببینید طرف راجب چیزی صحبت میکنه که به اندازه کافی علم داره ازش به مدل میگیم بعضی خطاها ممکنه اشتباه پارسر یا سرویس
OCR باشه و نادیدهاش بگیر.ولی اینجا مدلهای بالا با پرامپتی که من دادم دیگه اینطوری نشد و کلی ایراد الکی گرفتند.
بعنوان مثال :
Bug 1: __main__.py entrypoint is broken
You have:
if name == "main":
main()
That is wrong.
It must be:
if __name__ == "__main__":
main()
بدتر از اون اینکه بعضی مدلها حتی اینطوری میبیننش :
if name
من تمام مدلهایی که اسم بردم رو توی ۳ حالت استفاده کردم :
۱- با پرامپت سختگیرانه که بالاتر گفتم
۲- پرامپت ساده که فقط یک
role بهش دادم (این مشکلات وجود نداشت)۳-پرامپت سختگیرانه + استفاده از محیط چت و کپی پیست کد بعد از توضیح اینکه مطلب ارسالی کد پایتون هست.
و بهترین جواب رو حالت سوم داد؛ اگر به اندازه کافی کانال رو دنبال کرده باشید میدونید که من اصلا به هیچ ابزار و
agent ایی که دسترسی به سیستمم داشته باشه اعتماد ندارم و همیشه از محیطهای چت مرورگر استفاده میکنم و کدهام رو اونجا بهشون میدم.با دیدن این نتابج الان میفهمم چرا برای خیلی از شما سوال میشه که من چطوری از
Qwen, Duck.ai , ... استفاده میکنم و انقدر از خروجیهاش راضی هستم.
بنظرم شما هم این رو تست کنید- من فقط روی ۴ مدلی که اسم بردم تست کردم.

