TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
多模态 思维导图
›
Native 同构多模态
← 返回 多模态 思维导图
中文
·
English
👁️ 多模态
ID:
native-multimodal
Native 同构多模态
Native Any-to-Any Multimodal
🎯
核心定义
Native (原生/同构) 多模态指把图像、音频、文本统一离散化为同一种 token 序列, 在同一个 Transformer 主干上做自回归 next-token 预测: Chameleon (Meta) 用 VQGAN 把图像量化成 discrete image token, 与文本 token 混合后共享主干训练; GPT-4o 把音频也 token 化 (输入音频 → 输出文本/音频 token), 全模态共享注意力, 端到端输入到输出延迟约 320ms (实时语音对话); 所有模态统一为同一个训练目标
L
=
−
log
p
(
x
t
+
1
∣
x
1
:
t
)
\mathcal{L} = -\log p(x_{t+1} \mid x_{1:t})
L
=
−
lo
g
p
(
x
t
+
1
∣
x
1
:
t
)
。
💡
使用场景
实时语音助手 (GPT-4o voice)、任意输入到任意输出 (any-to-any) 生成、需要「听+看+读」联合推理的 Agent; 面试常考「native 与 modular (LLaVA 式) 的取舍」。
⚡
解决的核心痛点
模块化 VLM 是「编码器+投影器+LLM」的异质拼装, 各模态用不同 loss 分阶段训练, 模态间只在投影层交换信息, 难以做联合推理与低延迟流式交互; native 架构让所有模态在共享主干内以同一目标端到端训练, 模态间自由交互 (图像可以「影响」文本生成的中途), 天然支持流式输出与任意模态转换——代价是数据配比与训练稳定性难调、文本能力可能被多模态数据稀释 (需额外保护策略)。
🎯
5 个高频面试考点 (Exam Points)
1
原生多模态 (GPT-4o/Chameleon) 与模块化 VLM (LLaVA) 的核心区别?
2
图像怎么离散成 token 参与自回归训练?VQGAN 的作用?
3
GPT-4o 语音对话为什么延迟低?音频 token 化的好处?
4
统一 token 空间的代价是什么?为什么文本能力可能被稀释?
5
native 架构如何处理视频/长上下文?token 数与算力挑战?
📖 关联深度指南:
📄 vision-language-models →
更新于 2026-08-12
🎯
检验攻克程度:针对「Native 同构多模态」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
AnyRes 切块 / 动态 Token
下一个知识点 →
VLM 三阶段训练
🔗 更多 多模态 知识点卡片
语音识别 ASR
音频表示
Classifier-Free Guidance (CFG)
CLIP 应用