قدمت Skild AI نموذج S1، وهو النموذج الأساسي الجديد للشركة في مجال الروبوتات، والقادر على تعلم مهام لم يسبق له رؤيتها من عرض توضيحي واحد عبر الفيديو، من دون ضبط دقيق.
في منشور يوم الثلاثاءعلى X، قالت Skild AI إن S1 يستخدم التعلم ضمن السياق لتنفيذ مهام ممتدة الأفق تستمر حتى 10 دقائق. وأضافت الشركة أن S1 يستطيع تنفيذ هذه الإجراءات في بيئات متنوعة وعلى أجسام روبوتية مختلفة.
تشمل المهارات التي جرى عرضها إعداد القهوة، وزراعة نبات في أصيص، وقلي الفطائر، وهي مهام لم تكن موجودة في بيانات التدريب المسبق للنموذج.
قالت Skild AI: «في المرة الأولى التي قلب فيها S1 فطيرة، افترضنا أن قلب الفطائر لا بد أنه كان موجودًا في بيانات التدريب المسبق. بحثنا في كامل بيانات التدريب المسبق، ولم نعثر على أي أمثلة لقلب الفطائر. استنتج S1 المهمة الخارجة عن التوزيع من مطالبة واحدة عبر الفيديو».
وبحسب الشركة، يمثل S1 «تحولًا نوعيًا» مقارنة بنماذج الرؤية واللغة والفعل (VLA) التقليدية؛ إذ يمكنه مجاراة أداء نماذج VLA الموجهة باللغة في المهام المعروفة، ويتفوق على نماذج VLA الحالية الموجهة باللغة في تعلم مهام جديدة تمامًا.
وقدرت Skild AI أن نماذج VLA الحالية ستحتاج إلى جمع بيانات إضافية وضبط دقيق لمدة تتراوح بين 50 و100 ساعة للوصول إلى دقة مماثلة عند التعلم من مثال واحد.
وأشارت المجموعة أيضًا إلى أن نموذجها الجديد لا يقلد عرض الفيديو التوضيحي بشكل أعمى، بل يُظهر فهمًا «للحس السليم» يتجاوز المطالبة المقدمة. ويمكنه تحمل الاضطرابات، أو الارتجال، أو حتى إظهار دقة أكبر مما ظهر في الفيديو.
يوسع S1 قدرات Skild AI على التعلم ضمن السياق المتعلقة بالقدرة على الحركة، التي كشفت عنها الشركة في LocoFormer العام الماضي، والتي مكّنت روبوتًا من التكيف مع اضطرابات مثل تعطل الأرجل وانغلاق العجلات.
قالت Skild AI إنها بدأت نشر S1 لدى عدد محدود من الشركاء الصناعيين، وتخطط لطرحه على نطاق أوسع خلال الأشهر المقبلة.
