"Vision as Unified Multimodal Generation" (authors include Zhongang Cai, Lei Yang, and Dahua Lin): recasts dense vision tasks — detection, segmentation, depth, pose — as native interleaved text+image generation rather than task-specific heads. Ships SenseNova-Vision-7B-MoT (weights June 29, CC-BY-NC-4.0), a 50M-sample training corpus, and an evaluation suite repackaging 52 standard vision benchmarks. SenseTime's entry in the unified-vision-generation wave.

Outputs 2

SenseNova-Vision-7B-MoT

model
Parameters 7B
License CC-BY-NC-4.0

Vision as Unified Multimodal Generation

paper
visionmultimodalunified-generation