返回 多模态 思维导图
中文·English
👁️ 多模态ID: native-multimodal

Native 同构多模态

Native Any-to-Any Multimodal
🎯核心定义
Native (原生/同构) 多模态指把图像、音频、文本统一离散化为同一种 token 序列, 在同一个 Transformer 主干上做自回归 next-token 预测: Chameleon (Meta) 用 VQGAN 把图像量化成 discrete image token, 与文本 token 混合后共享主干训练; GPT-4o 把音频也 token 化 (输入音频 → 输出文本/音频 token), 全模态共享注意力, 端到端输入到输出延迟约 320ms (实时语音对话); 所有模态统一为同一个训练目标 L=logp(xt+1x1:t)\mathcal{L} = -\log p(x_{t+1} \mid x_{1:t})
💡使用场景
实时语音助手 (GPT-4o voice)、任意输入到任意输出 (any-to-any) 生成、需要「听+看+读」联合推理的 Agent; 面试常考「native 与 modular (LLaVA 式) 的取舍」。
解决的核心痛点
模块化 VLM 是「编码器+投影器+LLM」的异质拼装, 各模态用不同 loss 分阶段训练, 模态间只在投影层交换信息, 难以做联合推理与低延迟流式交互; native 架构让所有模态在共享主干内以同一目标端到端训练, 模态间自由交互 (图像可以「影响」文本生成的中途), 天然支持流式输出与任意模态转换——代价是数据配比与训练稳定性难调、文本能力可能被多模态数据稀释 (需额外保护策略)。
🎯5 个高频面试考点 (Exam Points)
1
原生多模态 (GPT-4o/Chameleon) 与模块化 VLM (LLaVA) 的核心区别?
2
图像怎么离散成 token 参与自回归训练?VQGAN 的作用?
3
GPT-4o 语音对话为什么延迟低?音频 token 化的好处?
4
统一 token 空间的代价是什么?为什么文本能力可能被稀释?
5
native 架构如何处理视频/长上下文?token 数与算力挑战?
📖 关联深度指南:📄 vision-language-models
更新于 2026-08-12
🎯
检验攻克程度:针对「Native 同构多模态」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点AnyRes 切块 / 动态 Token下一个知识点VLM 三阶段训练

🔗 更多 多模态 知识点卡片

语音识别 ASR音频表示Classifier-Free Guidance (CFG)CLIP 应用