Pin transformers==4.57.6 (matches upstream LabVLA's exact tested env); unbounded >=4.57.0 was resolving to transformers 5.x, which changed Qwen3VLVisionModel.forward() to return a 3-field ModelOutput instead of a 2-tuple, breaking image_embs, _ = self.vlm.model.visual(...) unpacking