بكين-سانا
أعلنت شركة “شاومي” الصينية إطلاق أول نموذج لها في مجال الروبوتات الكبيرة تحت اسم Xiaomi-Robotics-0، وهو نظام يجمع بين الرؤية الحاسوبية والفهم اللغوي وتنفيذ الحركات الفعلية، ويضم نحو 4.7 مليارات معلمة.
وذكر موقع «TechNode» المتخصص في أخبار التكنولوجيا، أن الشركة أوضحت أن النموذج حقق نتائج متقدمة في الاختبارات الافتراضية والتطبيقات الواقعية، ويستهدف ما تصفه بـ«الذكاء الفيزيائي»، أي الدمج بين الإدراك واتخاذ القرار والتنفيذ الحركي.
ويعتمد النموذج على معمارية «Mixture-of-Transformers»، وينقسم إلى مكوّنين رئيسيين: نموذج بصري-لغوي يعمل بمثابة «دماغ» الروبوت لفهم التعليمات البشرية ومعالجة الصور والتفكير المنطقي، ومكوّن حركي قائم على «Diffusion Transformer» متعدد الطبقات لتوليد تسلسل حركات دقيقة وسلسة.
وأشارت الشركة إلى أن النموذج خضع لتدريب مشترك على بيانات متعددة الوسائط والحركة، بهدف الحفاظ على قدراته الإدراكية أثناء تعلم المهام الحركية، مع إدخال تحسينات تقنية لتقليل زمن الاستجابة وتعزيز استقرار الأداء.
وفي الاختبارات، سجل النظام نتائج متقدمة في عدد من بيئات المحاكاة، كما جرى تطبيقه على روبوت ذي ذراعين أظهر قدرة على تنسيق العين واليد في مهام معقدة، مثل طي المناشف وتفكيك المكعبات، مع التعامل مع مواد صلبة ومرنة بكفاءة.
ويُنظر إلى هذا النموذج بوصفه خطوة متقدمة لشركة شاومي نحو تطوير روبوتات قادرة على الجمع بين الفهم اللغوي والإدراك البصري والتنفيذ الفيزيائي، في إطار المنافسة المتصاعدة عالمياً في مجال الروبوتات الذكية.