Visual reasoning without text chain-of-thought: UniVR-34B generates visual reasoning traces directly, built on ByteDance's Emu3.5 with two-stage SFT (310K samples) and VR-GRPO reinforcement learning. Reports +25% over its base on VR-X across robotic manipulation, editing, spatial reasoning, and puzzles — a bet that some reasoning is better done in pixels than tokens.

Model Details

Parameters 34B
multimodalreasoningopen-weight