SenseNova-Vision
model paper Your tags
Your notes
"Vision as Unified Multimodal Generation" (authors include Zhongang Cai, Lei Yang, and Dahua Lin): recasts dense vision tasks — detection, segmentation, depth, pose — as native interleaved text+image generation rather than task-specific heads. Ships SenseNova-Vision-7B-MoT (weights June 29, CC-BY-NC-4.0), a 50M-sample training corpus, and an evaluation suite repackaging 52 standard vision benchmarks. SenseTime's entry in the unified-vision-generation wave.