موسسه پژوهشی Andon Labs نتایج بنچمارک جدید Blueprint-Bench 2 را برای ارزیابی توانایی مدلهای هوش مصنوعی در استدلال فضایی سهبعدی و بازسازی نقشه ساختمان منتشر کرد. در این آزمون، ایجنتهای هوش مصنوعی وظیفه دارند با بررسی مجموعهای از حدود ۲۰ عکس از فضای داخلی ۵۰ آپارتمان مختلف، نقشه دوبعدی دقیق معماری (پلان طبقات شامل ابعاد، اتصالات میان اتاقها و موقعیت دربها) را ترسیم کنند. این وظیفه فراتر از تشخیص ساده تصاویر است و به استنباط هندسی واقعی، چرخش زاویه دید و درک مقیاس نیاز دارد. همچنین به هر ایجنت یک یادداشت پایدار داده میشود تا تجربیات، الگوهای چیدمان و درسهای آموختهشده را در طول پردازش ۵۰ واحد مسکونی ذخیره کند و استراتژی خود را بهبود بخشد.
یافتههای این بنچمارک نشان میدهد که مدل Claude Opus 5.5 شرکت انتروپیک با کسب امتیاز ۰.۵۱۲ (۵۱.۲ درصد) در صدر جدول قرار گرفته و در درک ساختار فضاهای سهبعدی از تمام مدلهای هوش مصنوعی پیشی گرفته است. در رتبههای بعدی، پرچمدار GPT-6 Astra اوپنایآی با ۰.۴۹۷ و Claude Fable 5.1 با ۰.۴۱۹ قرار دارند. نکته کلیدی در سنجش این بنچمارک، همپوشانی اتصالات اتاق به اتاق (شاخص جاکارد با سهم ۵۰ درصدی) است؛ جایی که مدلها در شمارش تعداد اتاقها دقتی نزدیک به ۹۰ درصد دارند، اما مدلهای ضعیفتر در تشخیص اینکه کدام در به کدام اتاق راه دارد کاملاً با مشکل روبرو میشوند. برای نمونه، مدلهای کوچکی مانند Gemini 3 Flash، Claude Haiku 4.5 و حتی مدل تخصصی رباتیک Gemini Robotics-ER 1.6 امتیازی نزدیک به صفر ثبت کردهاند.
اگرچه در حال حاضر هیچ مدلی به رکورد کارشناسان انسانی با امتیاز ۰.۵۸۶ (۵۹ درصد) نرسیده است، اما تحلیل آماری لوکاس پیترسون (بنیانگذار Andon Labs) از روند پیشرفت مدلهای پیشرو در سال ۲۰۲۶ نشان میدهد که سرعت بهبود توان استدلال فضایی با آهنگ ثابت ۴ درصد در ماه (با ضریب همبستگی بالا) در حال رشد است. طبق این برونیابی، خط روند مدلهای فرانتیر در حوالی نوامبر ۲۰۲۶ از خط مبنای انسانی عبور خواهد کرد؛ تحولی بنیادین که نشان میدهد پیش از پایان سال جاری میلادی، هوش مصنوعی در بازسازی شهودی فضاهای سهبعدی فیزیکی از روی تصاویر پراکنده، به سطحی فراتر از دقت انسان دست خواهد یافت.
@ACCELERATIONERS


