这篇论文的核心目标是构建一种统一的离散多模态建模范式:将图像、音频与文本共同表示为离散 token,并统一纳入 next-token prediction 的自回归建模框架。作者指出,现有多数多模态模型仍以语言为中心,视觉和音频通常以外接模块的形式接入,导致模型架构、表征空间以及理解与生成目标之间存在明显割裂。为此,论文提出了 DiNA(Discrete Native Autoregressive) 框架,并在此基础上构建 LongCat-Next,以实现文本、图像和音频在统一离散空间中的联合建模。
在此基础上,论文进一步聚焦于一个关键问题:视觉模态在离散化后,是否会因信息损失而天然弱于连续表征模型的理解能力。 作者的核心观点是,离散视觉 token 并不必然导致理解性能下降;如果预量化表征具备充分的语义完备性,并辅以合理的量化与反量化机制,那么离散 token 同样可以同时支持多模态理解与生成任务。
LongCat-Next 的整体思路可以概括成一条链:
图像 / 音频 / 文本 → 各自 tokenizer 变成离散 token → 统一送入同一个 AR backbone → 需要生成时再由各自 detokenizer 解码回图像或音频。 论文把这个统一建模框架称为 DiNA,其中视觉部分最关键的模块是 dNaViT (Discrete Native-Resolution Vision Transformer)。dNaViT 试图像语言 tokenizer 一样,给视觉提供一个“可理解、可生成、支持任意分辨率”的离散接口

论文整体是“模态专属 tokenizer / detokenizer + 模态无关 AR backbone”的设计。也就是说,视觉和音频仍然保留少量前后端模块,但真正的核心建模发生在统一的离散 token 序列上。论文明确说,DiNA 的优化被分成两大阶段:先训练各模态 tokenizer / detokenizer,再做 unified multimodal training。
从理念上看,这篇工作不是在做“给 LLM 接个视觉 encoder”,而是在做 native multimodality:图像和音频不再只是外部连续特征,而是变成可进入语言范式的原生 token。
论文认为,离散视觉建模有两个核心瓶颈。第一是视觉表示本身的容量问题:如果前端 encoder 学到的表示不够语义完备,那么即使后面量化得再好,也只是把“弱表示”离散化。第二是离散化本身的信息损失:图像是高密度连续信号,单层 codebook 很容易造成细节丢失。论文提出了两块对应设计:前者用 SAE 解决,后者用 RVQ 解决。
它把图像映射到预量化空间,这个空间需要保留足够的信息来支持 caption、OCR、QA、visual reasoning 等多种图像相关任务。换句话说,SAE 的要求不是“能重建图像”,而是“对图像相关语义任务来说尽量无损”。