做面试官这几年,聊过的候选人差不多八百个了。每次校招季,被问得最多的就是:纯 LLM、AIGC、多模态,到底该押哪条路?业界报告和市场规模那些虚的就不扯了,直接从我筛选简历、拍板发 offer 的视角,把这三个方向的用人真相说清楚。
时间坐标是 2026 年初。大模型技术迭代太快,去年的香饽饽今年就可能卷成红海,看准当下节点很重要。
核心结论:优先 all in 多模态
如果目标是冲高质量算法岗,要长期价值、高上限、低替代风险,那就直接攻多模态。原因拆开看。
三条赛道的真实就业现状
纯语言大模型:基建化完成,算法岗加速内卷
2025 年的纯 LLM 赛道,关键词就两个:基建化、工程化。从头训一个 SOTA 基座模型,早就不是普通公司能玩的了——那是巨头比拼千亿卡算力、海量数据和顶尖研究团队的战场。OpenAI、Google、Meta 以及国内几家大厂才能站上牌桌,留给普通人的创新空间极小。
应届生进来,绝大部分做的不是核心架构,而是下游应用:
- 微调:拿开源基座模型灌行业垂类数据,LoRA、QLoRA 这些轻量化方案越来越成熟,门槛持续走低,正演变成熟练工种。
- RAG:去年爆火,现在已是标配。做嵌入优化、检索精度提升、压幻觉,工程化经验多过算法创新,核心瓶颈头部团队已经啃完了。
- Agent 开发:看似前沿,实质是提示工程加工具调用和简单规划逻辑,重度依赖基座能力,开发者更像使用者而非创造者,很难堆出技术壁垒。
- 模型压缩、量化与部署:需求稳定务实,但偏 ML Engieering,离核心算法越来越远,薪资天花板相对固定。
纯 LLM 方向的岗位正在两极分化:极少数顶尖人才在核心团队搞预训练算法或结构创新,门槛高得离谱;绝大多数落到应用层工程岗,内卷凶猛。薪资起薪不低,白菜价 SP 不难拿,但天花板被基座能力锁死,个人价值杠杆有限。
AIGC:边界模糊,算法属性弱化
先澄清一个认知:AIGC 这个概念太宽,本质把纯 LLM 和多模态的不少场景都包了进去。可招聘市场上 'AIGC 方向' 更多指产品落地和应用封装,不是核心算法。
比如开发 AI 海报工具、智能视频剪辑平台、AI 辅助编程插件,这类岗位分工很细:少数人维护模型优化,多数人是应用算法或后端工程师,日常重心是封装 API、嵌入业务流程、调优产品体验,而不是深耕模型本身。
这个方向的好处是离业务近,变现路径清晰,能很快看到工作成果。想做核心算法的就不划算了——大量时间花在数据清洗、业务逻辑对接、API 调试上,技术深度难累积。薪资方差极大:头部商业化产品核心成员能拿高薪加期权,还没找到盈利模式的创业公司,薪资可能还不如大厂工程岗稳定。
多模态大模型:技术蓝海,需求爆发
这才是我最看好的方向。三个原因:
第一,技术前沿,是 AGI 的必经之路。 人类认知世界本来是多模态的,文字、图像、声音、触觉,纯文本 LLM 再强也只是「缸中之脑」。从 DALL·E、Midjourney 的文生图,到 Sora 的文生视频,再到未来的具身智能、自动驾驶多感官融合,核心突破必定发生在多模态。
这个领域还有大量根本性问题没解决:跨模态对齐、统一表征学习、长视频生成的时空一致性、3D 场景理解与生成、多模态交互逻辑……每个方向都可能挖出金矿,普通人也有机会做出创新成果。在这里你不是模型的使用者,更可能变成规则的制定者。
第二,技术壁垒高,护城河难复制。 多模态要同时吃透 NLP 和 CV 的核心技术,部分场景还得懂图形学、语音、物理仿真,天然筛掉大批人。LLM 应用层那套,刷博客、跑开源 demo 就能快速上手;但多模态的 Diffusion 数学原理、NeRF 神经辐射场、DiT 扩散 Transformer,非深耕底层的根本啃不动。
我团队有个 CV 背景的工程师,LLM 热潮时没跟风,专注 3D 生成和多模态融合。当时大家都觉得方向太窄。结果 2025 年 Sora 引爆视频生成赛道,大厂疯狂布局多模态视频、3D 内容生产,他靠着扎实的 DiT 架构优化、视频压缩网络设计等细节,拿到的 offer 比同级 LLM 岗高出 30% 以上。这潮水一退,深耕者就站住了。
第三,需求爆发,人才供给严重不足。 随手搜招聘平台,「多模态算法工程师」要求高、薪资范围宽,很多公司甚至愿意对学历和工作年限放宽——就是因为能打底层技术能力的人太稀缺,企业肯付溢价。
LLM 方向求职者扎堆,简历上都写「精通 LangChain、熟练搭建 RAG 系统」,同质化严重,只能拼学历和实习。多模态就不一样,你只要吃透一个细分点,比如视频生成或 3D 多模态,就能打出差异化。
应用岗 vs 算法岗,多模态两边都有机会
纠结选应用还是算法,其实是在选职业定位。多模态这两个方向都有好坑位:
- 多模态算法岗:重心在生产工具,聚焦模型性能优化、底层技术创新,产出是模型、论文或专利。对技术深度和数学基础要求极高,适合喜欢钻底层的人。
- 多模态应用岗:重心在用工具,把模型能力落地到具体业务,产出是上线产品和业务指标。比如为电商搭虚拟试衣系统,或为教育产品做多模态讲解工具。
当前应用岗需求也涨得很快:视频平台用多模态做内容摘要和违规审查,电商用文生图生成商品素材,设计软件(如 Adobe Firefly)嵌入多模态生成,游戏行业用 AI 生成 3D 场景和 NPC 动画。这些岗位技术经验能积累,业务也贴近,对应届生是好选择。
深耕多模态的四条实战建议
下面这些,都是我和身边人踩过坑后验证过的避坑指南。
1. 动手跑通项目,别用收藏论文感动自己
很多人收藏上百篇论文,却没真正搞透一个基础模型的代码逻辑。面试一戳就破。真正的积累必须靠实操。
做法很简单:聚焦一个细分点(视频生成、3D 多模态),选 1-2 个主流开源项目(比如 Open-Sora、Latte、Stable Video Diffusion),像做毕设一样逐行啃代码,全程跑通:
- 拆解数据处理逻辑:数据怎么清洗、分块,为什么那么设计 patch 划分方式。
- 吃透核心模块:DiT 怎么融入文本条件,代码里哪段对应技术报告的哪个原理。
- 主动去踩坑 debug:显存溢出、loss 异常、生成效果烂,别一上来就搜答案,先自己逐行排查,把 GitHub Issue 和技术社区讨论翻一遍。这过程比看一百篇论文都值。
没算力就租卡,AutoDL 这类平台几十块就能租到高性能 GPU,这笔投入省不了。简历上的「精通多模态」,得靠实实在在跑通项目、魔改代码来撑。
2. 补数学和基础,别患上开源工具依赖症
光会用开源工具搭 demo 很容易,但没基本功走不远。不必从头推导公式,但得理解核心数学逻辑:Diffusion 的加噪-去噪过程、Transformer 注意力机制、跨模态对齐的数学原理。
训练多模态模型时,如果生成的全是噪声,懂底层的会去排查 time embedding 和条件解耦模块,不懂的就只能反复检查数据格式,无效试错。数学和基础,是把「能干活」和「会解决复杂问题」区分开的关键。
3. 融合交叉领域知识,做出差异化
多模态的核心在「融合」,单一领域知识壁垒不够厚。如果你有物理、图形学、信号处理等背景,千万别丢——这会成为独特优势。
Sora 带火的「世界模型」概念,本质是用多模态模型模拟物理世界规律。要让模型生成符合流体力学的水流、保持刚体碰撞逻辑的动画,纯数据驱动的开发者可能束手无策,而具备物理、图形学基础的人可以快速找到解法。
建议花时间补充:计算机图形学(渲染管线、3D 建模)、信号处理(音频表征、视频编码)、物理仿真基础。这些知识能让你在跨模态任务里避坑,形成别人难复制的竞争力。
4. 明确职业定位:深度路线还是广度路线
别卡在「半瓶水」状态——技术不深、能力不广,只会调参跑开源项目,这种求职者最容易被替代。
- 深度路线:聚焦一个细分方向(比如视频生成的时空一致性、3D 多模态对齐),吃透相关论文和开源项目,做出创新性优化。这类人才是大厂核心团队眼中的宝贝。
- 广度路线:不追求单一深度,而是掌握多模态全链路,能把文生图、文生视频、语音识别等不同模型组合成复杂系统,同时具备工程部署和业务理解能力。这种人在创业公司或业务导向团队很吃得开。
选一条,扎下去。
大模型学习进阶路径
如果你想系统补课,可以参考我整理的建议顺序,不必严格按天数,重点是掌握这些能力:
第一步:理解基础应用 先搞明白大模型到底能干什么、怎么「智能」起来的,用好它的核心心法。学会写提示词、掌握指令调优和思维链的基本思想,能写简单代码把大模型和业务接起来。这个阶段过后,你对大模型的理解会超过大多数人。
第二步:掌握高阶应用 进入实战,学会构造私有知识库扩展模型能力,快速开发一个基于 Agent 的对话机器人。要弄懂 RAG 的完整链路:检索基础、向量表示、向量数据库、混合检索与 fusion,甚至本地部署向量模型。这部分能让你的技能落在产品上。
第三步:进入模型训练 到这个阶段,你可以自己动手训模型了。从理解什么是模型训练、微调、轻量化微调开始,到亲手实现一个简单的神经网络,熟悉 Transformer 结构,掌握 LoRA 等微调方法,构建实验数据集。拿开源多模态模型练手,独立跑通训练流程。
第四步:实现商业闭环 对全球大模型从性能、吞吐量、成本等方面建立认知,学会在不同环境(云端/本地)部署大模型。了解硬件选型、内容安全策略,甚至动手在阿里云上部署 Stable Diffusion 或开源 LLM 项目。走到这儿,你已经能把模型转化为产品,有能力自己带项目或创业。
学习过程不用贪多求快,能走通 60-70% 的内容,就足够让你在求职时有扎实的底气了。

