返回 多模态 思维导图
中文·English
👁️ 多模态ID: llm-backbone

LLM 底座 (跨模块)

LLM Backbone (cross-module)
🎯核心定义
VLM 与语音 LLM 复用 LLM 作为统一主干——Transformer 架构、注意力机制、预训练-对齐-SFT 范式、KV Cache 与推理优化均继承自 LLM 底座。
💡使用场景
多模态面试追问"多模态模型底座怎么来"时, 按 LLM 模块知识回答。
解决的核心痛点
多模态模型无需从零训练文本能力, 直接继承推理、指令跟随与工具调用先验。详见 LLM 模块: Transformer 架构与对齐见 LLM 模块 (指南 transformer-architecture)。
🎯5 个高频面试考点 (Exam Points)
1
VLM 与 LLM 在架构/训练范式上分别复用与新增了什么?
2
多模态 token 与文本 token 如何在同一个 Transformer 主干中统一处理?
3
为什么说多模态模型的能力上限受限于 LLM 底座?
4
长上下文 (视频/高分辨率图像) 下 KV Cache 与推理优化面临什么挑战?
5
多模态预训练与 LLM 预训练在对齐目标上有何不同?
📖 关联深度指南:📄 transformer-architecture
更新于 2026-08-12
🎯
检验攻克程度:针对「LLM 底座 (跨模块)」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点世界模型应用下一个知识点具身智能 (跨模块)

🔗 更多 多模态 知识点卡片

语音识别 ASR音频表示Classifier-Free Guidance (CFG)CLIP 应用