UniVR-34B
model Your tags
Your notes
Visual reasoning without text chain-of-thought: UniVR-34B generates visual reasoning traces directly, built on ByteDance's Emu3.5 with two-stage SFT (310K samples) and VR-GRPO reinforcement learning. Reports +25% over its base on VR-X across robotic manipulation, editing, spatial reasoning, and puzzles — a bet that some reasoning is better done in pixels than tokens.
Model Details
Parameters 34B