World Labs لفاي فاي لي تكشف عن نموذج العالم Atlas
أطلقت World Labs، الشركة الناشئة التي أسستها رائدة الذكاء الاصطناعي فاي فاي لي، في الأول من سبتمبر نموذج Atlas: نموذج عالم يعيد بناء مشاهد ثلاثية الأبعاد من صورة واحدة ويحاكي المكان والزمان.

كشفت شركة World Labs الناشئة للذكاء الاصطناعي، التي أسستها أستاذة جامعة ستانفورد ورائدة الذكاء الاصطناعي فاي فاي لي، في الأول من سبتمبر عن نموذج عالم جديد يحمل اسم Atlas. وتصف الشركة هذا النموذج بأنه «نموذج شامل» صُمم منذ البداية لمعالجة النصوص والصور والفيديو وبيانات ثلاثية الأبعاد بشكل أصلي داخل نظام واحد، وتؤكد أنه قادر على إعادة بناء مشهد ثلاثي الأبعاد من صورة واحدة فقط، وتوليد فيديو عالي الدقة يصل طوله إلى دقيقة واحدة مع تحكم دقيق في الكاميرا، وإنتاج بيانات العمق التي تحتاجها الروبوتات للتدرب داخل بيئات محاكاة. ووصفت فاي فاي لي هذا الإطلاق بأنه إنجاز فارق بالنسبة لـ World Labs، قائلة إن Atlas يفتح الباب أمام تطبيقات تمتد من المؤثرات البصرية إلى الروبوتات.
ما الذي يستطيع Atlas فعله فعلاً
- التوليد بتحكم في الكاميرا: انطلاقاً من صورة مرجعية واحدة إلى ست صور، يولّد Atlas فيديو بتحكم دقيق في الكاميرا على مستوى البكسل، بمدة تصل إلى دقيقة واحدة وبدقة 1440p.
- إعادة البناء المكاني: عند تزويده بصورة واحدة إلى عشرات الصور، وأحياناً أكثر من مئة صورة، يعيد Atlas بناء مشاهد واقعية في صورة لقطات من زوايا جديدة، وكذلك في صورة مخرجات ثلاثية الأبعاد صريحة، سُحُب نقاط ونماذج غاوسية ثلاثية الأبعاد، متفوقاً على أفضل نماذج إعادة البناء ثلاثي الأبعاد المتخصصة.
- محاكاة المكان والزمان: انطلاقاً من فيديو عادي مصوَّر بعدد قليل من الهواتف، يستطيع Atlas تجميد مشهد وإعادة تأطيره من زوايا مستحيلة، كما يغذي مسارات عمل «من الواقع إلى المحاكاة» التي تتيح للروبوتات التدرب والاختبار داخل بيئات مولَّدة.
- توليد الصور: ينتج Atlas صوراً وبانوراما بزاوية 360 درجة انطلاقاً من نصوص، متبعاً تعليمات معقدة، ومصوِّراً نصوصاً واضحة للقراءة، ومغطياً طيفاً واسعاً من الأساليب البصرية.
في جوهره التقني، يمثل Atlas ما تسميه World Labs محوّل انتشار ذاتي التراجع متعدد الوسائط، جرى تدريبه من الصفر بدلاً من تطويعه من نموذج فيديو أو لغة موجود مسبقاً. فكل مُدخل، نص أو صورة أو وضعية كاميرا أو خريطة عمق ثلاثية الأبعاد، يُثبَّت في موضع داخل سياق مكاني مشترك، ويولّد Atlas مخرجاته الجديدة بناءً على كل ما هو موجود بالفعل في هذا السياق؛ فصورتان غير مرتبطتين، مثلاً، يمكن وضعهما في الفضاء الثلاثي الأبعاد ودمجهما في عالم واحد متصل ومتماسك. وهذا ما يميّز Atlas عن مولّدات الفيديو على غرار Sora التي توجّه حركة الكاميرا عبر توجيهات نصية غير دقيقة: فـ Atlas يتلقى مسارات الكاميرا وهندسة المشهد كمدخلات أصلية، مما يمنحه تحكماً دقيقاً في كل لقطة لا يمكن لنص وحده أن يوفره. وفي تقييمات تتعلق بالتوليد بتحكم في الكاميرا وبإعادة البناء انطلاقاً من زوايا نظر متفرقة، تقول World Labs إن Atlas تفوّق على أبرز نماذج الفيديو وعلى أفضل أنظمة إعادة البناء ثلاثي الأبعاد المتخصصة، مع تفوّق يزداد كلما ازدادت مسارات الكاميرا تعقيداً، وإن الأداء يواصل التحسن مع ازدياد القدرة الحاسوبية المخصصة للتدريب.
رهان على الروبوتات، لا على المؤثرات البصرية وحدها
يأتي هذا الإطلاق استكمالاً لمسار بدأته World Labs في وقت سابق من هذا العام. ففي يونيو، طرحت فاي فاي لي إطاراً يقسّم نماذج العالم إلى ثلاث فئات، المُصيِّرات والمحاكيات والمخطِّطات، مؤكدة أن المحاكي هو الأهم لأنه يحمل الهندسة والفيزياء والديناميكيات التي يعتمد عليها كل من التصيير والفعل. وفي 21 يوليو، استحوذت World Labs على SceniX، شركة ناشئة متخصصة في محاكاة الروبوتات؛ وبعد أسبوع، في 28 يوليو، كشفت عن نظام «من الواقع إلى المحاكاة ثم إلى الواقع» مبني على فكرة أن أكبر عائق أمام الروبوتات هو غياب خبرة تدريب رخيصة وقابلة للتحكم وقابلة للتوسّع. ويمثّل Atlas الحلقة التي تربط بين هذه الجهود: فهو قادر على تحويل صور أو مقاطع فيديو عادية إلى فضاء ثلاثي الأبعاد، ثم إلى زوايا استشعار وبيئات محاكاة متغيرة يحتاجها الروبوت للتدرب. ووصف جيم فان، رئيس أبحاث الروبوتات في Nvidia وأحد تلامذة فاي فاي لي السابقين، هذا الإطلاق بأنه خطوة كبيرة في مسار «من الواقع إلى المحاكاة» في مجال الروبوتات.
تولّد نماذج العالم أي عالم ممكن وتعيد بناءه وتحاكيه، بما يتيح لنا تصوير عوالم متخيَّلة للمبدعين، ومحاكاة العالم الحقيقي بدقة عالية، ومساعدة الروبوتات على تخطيط أفعالها.
تقول World Labs إنها تطرح Atlas تدريجياً، بدءاً بوصول مبكر لشركاء مختارين، فيما يمكن لبقية المستخدمين طلب الوصول عبر موقع الشركة. وتقدّم الشركة Atlas بوصفه الأساس الذي ستُبنى عليه الإصدارات المستقبلية من Marble، منتجها السابق للعوالم التفاعلية، وبقية منتجاتها. وبالنسبة لمختبرات الذكاء الاصطناعي واستوديوهات الألعاب والمؤثرات البصرية وشركات الروبوتات في مختلف الدول العربية، بما فيها المراكز التقنية الناشئة في الخليج التي تستثمر بكثافة في الذكاء الاصطناعي والروبوتات، فإن التغيير العملي يتمثل في مسار أرخص للحصول على بيانات ثلاثية الأبعاد قابلة للاستخدام: فبدلاً من معدات تصوير باهظة الثمن أو أشهر من العمل المتخصص في إعادة البناء ثلاثي الأبعاد، يمكن لبضع صور عادية أو مقطع فيديو من هاتف أن يصبح نقطة انطلاق لبيئة محاكاة أو مستوى لعبة أو ساحة تدريب لروبوت، شريطة أن تصمد هذه النتائج الأولية عندما يتمكن مزيد من الفاعلين في القطاع من اختبار Atlas بأنفسهم.
المصادر
- Atlas: A World Model for Spatial IntelligenceWorld Labs · ١ سبتمبر ٢٠٢٦
- 李飞飞发布:全球首个多模态世界模型量子位 (QbitAI) · ٢ سبتمبر ٢٠٢٦
- 李飛飛推出新一代世界模型 Atlas,模擬真實世界和機器人運作TechNews 科技新報 · ٢ سبتمبر ٢٠٢٦



