TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
多模态 思维导图
›
LLM 底座 (跨模块)
← 返回 多模态 思维导图
中文
·
English
👁️ 多模态
ID:
llm-backbone
LLM 底座 (跨模块)
LLM Backbone (cross-module)
🎯
核心定义
VLM 与语音 LLM 复用 LLM 作为统一主干——Transformer 架构、注意力机制、预训练-对齐-SFT 范式、KV Cache 与推理优化均继承自 LLM 底座。
💡
使用场景
多模态面试追问"多模态模型底座怎么来"时, 按 LLM 模块知识回答。
⚡
解决的核心痛点
多模态模型无需从零训练文本能力, 直接继承推理、指令跟随与工具调用先验。
详见 LLM 模块
: Transformer 架构与对齐见 LLM 模块 (指南 transformer-architecture)。
🎯
5 个高频面试考点 (Exam Points)
1
VLM 与 LLM 在架构/训练范式上分别复用与新增了什么?
2
多模态 token 与文本 token 如何在同一个 Transformer 主干中统一处理?
3
为什么说多模态模型的能力上限受限于 LLM 底座?
4
长上下文 (视频/高分辨率图像) 下 KV Cache 与推理优化面临什么挑战?
5
多模态预训练与 LLM 预训练在对齐目标上有何不同?
📖 关联深度指南:
📄 transformer-architecture →
更新于 2026-08-12
🎯
检验攻克程度:针对「LLM 底座 (跨模块)」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
世界模型应用
下一个知识点 →
具身智能 (跨模块)
🔗 更多 多模态 知识点卡片
语音识别 ASR
音频表示
Classifier-Free Guidance (CFG)
CLIP 应用