Unidentified T E A M: post #1771 — TG.ME

تلاش برای ساخت مجموعه داده‌های آموزشی هوش مصنوعی»
گرگوری کورتزر (Gregory Kurtzer)، بنیان‌گذار پروژه‌هایی مانند CentOS، Rocky Linux، Warewulf و Apptainer، پروژه جدیدی به نام OpenWALDO را معرفی کرد.
هدف OpenWALDO
ساخت یک مجموعه‌داده آموزشی مشترک، متن‌باز، دارای مجوز، قابل ردیابی و قابل ممیزی که جامعه هوش مصنوعی بتواند روی آن مدل‌های مختلف بسازد.

🔹 چرا OpenWALDO مهم است؟
امروز تقریباً هر شرکت یا آزمایشگاه هوش مصنوعی برای آموزش مدل‌های خود باید بخش زیادی از داده‌های آموزشی را از ابتدا جمع‌آوری و آماده کند.

این یعنی:
کارهای تکراری
هزینه زیاد
مشخص نبودن منبع بسیاری از داده‌ها
ابهام در مجوز استفاده
دشواری بررسی داده‌های آموزشی مدل‌ها

اما OpenWALDO می‌خواهد یک پایه مشترک و عمومی ایجاد کند تا این کارها به‌صورت مشارکتی انجام شوند.

🔍 مهم‌ترین ویژگی‌ها
1️⃣ داده‌های قابل ردیابی
برای داده‌ها مشخص می‌شود:
منبع داده چیست؟
چه مجوزی دارد؟
چه کسی آن را اضافه کرده؟
چه تغییراتی روی آن انجام شده؟
در چه مجموعه‌داده‌ای قرار گرفته است؟
2️⃣و AI BOM
ایده AI Bill of Materials یا AI BOM نیز در این پروژه اهمیت زیادی دارد.
مشابه SBOM در دنیای نرم‌افزار، هدف این است که بتوان مشخص کرد یک مدل هوش مصنوعی از چه منابع و اجزایی ساخته شده است.
یعنی بتوان مسیر زیر را دنبال کرد:
Data → Dataset → Training → Model → Release
3️⃣ مقابله با Model Collapse
یکی از مشکلات آینده هوش مصنوعی، چیزی است که به آن Model Collapse گفته می‌شود.
اگر مدل‌های جدید مرتباً روی خروجی مدل‌های قبلی آموزش ببینند، کیفیت و تنوع داده‌ها می‌تواند به‌مرور کاهش پیدا کند.
این OpenWALDO تلاش می‌کند با ایجاد داده‌های دارای منبع مشخص و قابل تأیید، بخشی از این مشکل را از ریشه مدیریت کند.
4️⃣ شفافیت در مجوزها
یکی از پرسش‌های مهم در آموزش مدل‌های AI این است:
آیا داده‌ای که برای آموزش استفاده شده، واقعاً اجازه استفاده داشته است؟

به‌خصوص برای:
محتوای دارای Copyright
کدهای نرم‌افزاری
داده‌های منتشرشده با مجوزهای مختلف
داده‌های تولیدشده توسط مدل‌های دیگر
این OpenWALDO می‌خواهد اطلاعات مجوز و منشأ داده‌ها را همراه آن‌ها نگه دارد.

🌐 یک مدل جدید برای همکاری
به‌جای اینکه:
هر شرکت → همه چیز را از صفر بسازد
مدل پیشنهادی این است:
Community → Shared Dataset → Multiple AI Models
یک نفر داده‌ای اضافه می‌کند.
فرد دیگری آن را بررسی می‌کند.
یک محقق داده را بهبود می‌دهد.
یک شرکت داده‌های اختصاصی خودش را به آن اضافه می‌کند.
و در نهایت، همه می‌توانند روی این پایه مشترک، مدل و محصول خودشان را توسعه دهند.

🐧 فلسفه‌ای شبیه Open Source
کورتزر معتقد است همان فلسفه‌ای که متن‌باز را در دنیای نرم‌افزار موفق کرد، می‌تواند در AI نیز استفاده شود:
قابل مشاهده → قابل بررسی → قابل اصلاح → قابل انشعاب → قابل اعتماد


و شاید مهم‌ترین تغییر این باشد:
آینده رقابت AI فقط بر سر «بهترین مدل» نخواهد بود؛ بلکه بر سر بهترین داده، منشأ داده و قابلیت اعتماد آن نیز خواهد بود.
August 14, 2026 62 1