Work / Robot learning, VLA Simulation
Language-conditioned manipulation
SmolVLA pick-and-place on dual Franka arms
This pipeline uses SmolVLA as the policy for bimanual pick-and-place on dual Franka arms in the Genesis simulator. SmolVLA takes multiple camera views and a language instruction and outputs a combined action for both arms.
Evaluation focused on task completion rate, grasp success and failure-mode breakdowns under randomised lighting and object placement, and these results drove each round of policy iteration.
In brief
- Language-conditioned bimanual manipulation
- Multi-camera input to a single VLA policy
- Evaluation under domain randomisation
- Data-driven iteration from failure analysis