Long-WAM ist ein Modell- und Systemansatz für die Steuerung von Robotern in Echtzeit. Die Forschenden trainieren zunächst kausale Vorhersagen anhand von Roboter- und Egoperspektivvideos, die keine Aktionslabels enthalten. Bei der späteren Anpassung an die Welt-Aktions-Steuerung bleibt die Verbindung zwischen vergangener Beobachtung und vorhergesagter Zukunft erhalten. So soll das Modell frühere Bildinformationen nutzen können, ohne dass ihre Verarbeitung die Steuerung ausbremst.
Auf RoboCasa GR-1 erhöhte eine Ausweitung des Kontexts von 0,0 auf 19,2 Sekunden die Erfolgsquote von 63,3 auf 78,7 Prozent. Mit einer bidirektional vortrainierten Grundlage ergab sich laut Paper dagegen kein Nettozuwachs durch den längeren Kontext. Zusätzliches autoregressives Vortraining mit Roboterdaten steigerte die Höchstwerte auf GR-1 und LIBERO-Long. In Vergleichen erzielte Long-WAM laut den Forschenden die besten Ergebnisse auf LIBERO-Long, RoboTwin 2.0 und DOMINO.
Für den Einsatz auf Hardware kombinieren die Forschenden eine laufende Verarbeitung der Beobachtungen mit asynchroner Ausführung und hardwarebezogener Beschleunigung. Long-WAM wurde auf RTX 5090, DGX Spark und Jetson AGX Thor eingesetzt, ohne die Vorhersage künftiger Bildinformationen zu entfernen. Auf einer RTX 5090 dauerte die Berechnung eines Aktionsabschnitts einschließlich dieser Vorhersage 107,4 Millisekunden.
Getestet wurde das System außerdem auf den Robotern Unitree G1 und YAM. Bei dynamischem Becherstapeln erreichte Long-WAM eine Erfolgsquote von 95 Prozent. Pi0.5 und Fast-WAM waren in jeweils 20 Versuchen nicht erfolgreich. Das Paper beschreibt Long-WAM zudem als Ausführungsmodell, das höherstufige Planung bei zusammengesetzten Aufgaben ergänzen kann.
