گرگوری کورتزر (Gregory Kurtzer)، بنیانگذار پروژههایی مانند CentOS، Rocky Linux، Warewulf و Apptainer، پروژه جدیدی به نام OpenWALDO را معرفی کرد.
هدف OpenWALDO
ساخت یک مجموعهداده آموزشی مشترک، متنباز، دارای مجوز، قابل ردیابی و قابل ممیزی که جامعه هوش مصنوعی بتواند روی آن مدلهای مختلف بسازد.
🔹 چرا OpenWALDO مهم است؟
امروز تقریباً هر شرکت یا آزمایشگاه هوش مصنوعی برای آموزش مدلهای خود باید بخش زیادی از دادههای آموزشی را از ابتدا جمعآوری و آماده کند.
این یعنی:
❌ کارهای تکراری
❌ هزینه زیاد
❌ مشخص نبودن منبع بسیاری از دادهها
❌ ابهام در مجوز استفاده
❌ دشواری بررسی دادههای آموزشی مدلها
اما OpenWALDO میخواهد یک پایه مشترک و عمومی ایجاد کند تا این کارها بهصورت مشارکتی انجام شوند.
🔍 مهمترین ویژگیها
1️⃣ دادههای قابل ردیابی
برای دادهها مشخص میشود:
منبع داده چیست؟
چه مجوزی دارد؟
چه کسی آن را اضافه کرده؟
چه تغییراتی روی آن انجام شده؟
در چه مجموعهدادهای قرار گرفته است؟
2️⃣و AI BOM
ایده AI Bill of Materials یا AI BOM نیز در این پروژه اهمیت زیادی دارد.
مشابه SBOM در دنیای نرمافزار، هدف این است که بتوان مشخص کرد یک مدل هوش مصنوعی از چه منابع و اجزایی ساخته شده است.
یعنی بتوان مسیر زیر را دنبال کرد:
Data → Dataset → Training → Model → Release
3️⃣ مقابله با Model Collapse
یکی از مشکلات آینده هوش مصنوعی، چیزی است که به آن Model Collapse گفته میشود.
اگر مدلهای جدید مرتباً روی خروجی مدلهای قبلی آموزش ببینند، کیفیت و تنوع دادهها میتواند بهمرور کاهش پیدا کند.
این OpenWALDO تلاش میکند با ایجاد دادههای دارای منبع مشخص و قابل تأیید، بخشی از این مشکل را از ریشه مدیریت کند.
4️⃣ شفافیت در مجوزها
یکی از پرسشهای مهم در آموزش مدلهای AI این است:
آیا دادهای که برای آموزش استفاده شده، واقعاً اجازه استفاده داشته است؟
بهخصوص برای:
محتوای دارای Copyright
کدهای نرمافزاری
دادههای منتشرشده با مجوزهای مختلف
دادههای تولیدشده توسط مدلهای دیگر
این OpenWALDO میخواهد اطلاعات مجوز و منشأ دادهها را همراه آنها نگه دارد.
🌐 یک مدل جدید برای همکاری
بهجای اینکه:
هر شرکت → همه چیز را از صفر بسازد
مدل پیشنهادی این است:
Community → Shared Dataset → Multiple AI Models
یک نفر دادهای اضافه میکند.
فرد دیگری آن را بررسی میکند.
یک محقق داده را بهبود میدهد.
یک شرکت دادههای اختصاصی خودش را به آن اضافه میکند.
و در نهایت، همه میتوانند روی این پایه مشترک، مدل و محصول خودشان را توسعه دهند.
🐧 فلسفهای شبیه Open Source
کورتزر معتقد است همان فلسفهای که متنباز را در دنیای نرمافزار موفق کرد، میتواند در AI نیز استفاده شود:
قابل مشاهده → قابل بررسی → قابل اصلاح → قابل انشعاب → قابل اعتماد
و شاید مهمترین تغییر این باشد:
آینده رقابت AI فقط بر سر «بهترین مدل» نخواهد بود؛ بلکه بر سر بهترین داده، منشأ داده و قابلیت اعتماد آن نیز خواهد بود.