这篇文章想把目前大模型领域比较主流的研究方向做一个全景梳理。下面大致按照从训练到应用、从模型本身到外部系统的顺序展开。
很多方向交叉得很严重,比如 Long Context 既涉及模型架构,也涉及 RAG 和 Memory;Agent 又会同时用到 Reasoning、Tool Use、Multimodal 和 Safety。所以这里的分类主要是为了方便理解,并不代表学界已经形成了一套标准目录。另外,不是所有方向我都了解得很深入,有些只能讲个大概,欢迎补充和纠正。
01 Training Data and Scaling
这个方向主要研究大模型训练数据的来源、规模、质量、组成比例,以及在给定计算预算下,如何合理分配模型参数、训练数据和计算资源。
早期大家比较热衷于堆参数,后来 Scaling Laws 相关研究逐渐说明,模型参数、训练 Token 数量和计算量之间需要保持合适的比例。参数规模过大、训练数据不足,可能导致模型没有得到充分训练。Chinchilla 之后,很多工作开始把重点放到数据规模和数据质量上,于是大家就从卷参数逐渐卷到了数据。
相关的二级方向主要有:
1. 数据清洗与数据配比
论文里常见的 motivation 一般是:网络数据中包含大量重复内容、广告文本、低质量机器翻译、隐私信息、错误知识和有害内容,直接拿来训练会影响模型性能。
常见做法包括数据去重、质量分类、语言识别、敏感信息过滤、版权检查,以及对代码、数学、书籍、论文、论坛和多语种数据进行比例调整。这个方向看起来像数据工程,实际上非常影响最终模型的知识结构、语言风格和能力分布。同样的模型架构,换一套数据配方,最后训练出来的东西可能差别相当大。
2. 数据选择与课程学习
这一块主要研究哪些训练样本更有价值,以及不同训练阶段应该采用什么样的数据顺序和难度安排。
常见方法包括质量评分、难度排序、领域动态采样、数据影响分析和主动数据选择。比较典型的思路是:训练预算有限,不能默认每个 Token 的价值都一样,因此需要尽量把计算资源分配给信息密度更高的样本。Curriculum Learning 也属于这一块,比如先训练相对简单和通用的数据,再逐步增加专业数据、复杂推理数据和长文本数据。
3. 合成数据
个人感觉这是目前卷中之卷的方向之一。
常见背景是:高质量人工数据越来越难获得,于是利用能力较强的模型生成解题过程、指令问答、代码样本、偏好数据和稀缺场景数据,再拿这些内容训练后续模型。方法上通常要做筛选、验证、去重、难度控制,有时还会用另一个模型、Reward Model、代码执行器或数学验证器进行过滤。
讲究一点的论文还会讨论 Model Collapse。未经控制地反复使用模型生成内容,可能导致训练数据的多样性逐渐下降,长尾信息消失,错误和偏见也可能被一代代放大。当然,这并不意味着合成数据本身有问题,关键还是数据生成、验证和真实数据混合的方式。
4. Continual Pre-training
动机无非就是通过持续预训练补充新知识、新语言或专业领域知识。比如一个通用模型已经训练完成,现在希望它掌握最新论文、某个行业的专业材料,或者提升某种低资源语言的能力,就可以继续进行领域预训练。
研究难点包括灾难性遗忘、知识冲突、训练成本控制、新旧数据比例,以及新增训练数据的版权和隐私问题。模型学会新知识之后,旧知识会不会被覆盖,也是一个长期存在的问题。
5. Summary
这个方向的核心问题,是训练数据的质量、规模和结构如何共同影响模型能力。如果把模型训练看成一个完整系统,那么参数规模只是其中一个变量。数据从哪里来、如何清洗、怎样配比、按照什么顺序训练,很多时候同样重要。
相关文献:
- Vaswani et al., Attention Is All You Need, NeurIPS 2017
- Hoffmann et al., Training Compute-Optimal Large Language Models
- Li et al., DataComp-LM: In Search of the Next Generation of Language Model Pretraining Datasets
- Shumailov et al., AI models collapse when trained on recursively generated data, Nature 2024
02 Model Architecture
这个方向关注大模型内部计算结构的设计,包括信息如何表示、不同 Token 之间如何交换信息,以及如何在扩大模型容量的同时控制计算和存储成本。
Transformer 仍然是当前大语言模型的主流架构,原因在于并行训练能力较强、Scaling 规律相对稳定,软硬件生态也已经比较成熟。与此同时,Self-Attention 在长序列上的计算量和显存开销比较大,于是大家一直在想办法改 Attention、改位置编码、改网络层,或者干脆研究 Transformer 之外的新架构。
相关的二级方向主要有:
研究内容包括高效 Attention、位置编码、Normalization、激活函数、KV Cache 和网络层配置。譬如 FlashAttention 通过优化 GPU 内存访问方式,提高了精确 Attention 的计算速度。它并没有近似 Attention 结果,主要优化的是计算过程中的 IO 开销。滑动窗口 Attention、稀疏 Attention、分块 Attention 等方法则尝试降低长序列的计算和存储成本。
除此之外,RoPE 外推、Grouped Query Attention、Multi-Query Attention 也都属于实际模型中比较常见的优化。这个方向很多工作看起来只是改了一个模块,但模型一旦扩展到几百亿参数、几万张卡,微小的效率变化都可能对应非常可观的训练成本。
2. Mixture of Experts
MoE 的故事一直比较稳定:模型包含多个 Expert 子网络,每个 Token 只激活其中少量 Expert,从而在控制单次计算量的情况下扩大模型总参数规模。需要特别注意,MoE 模型的总参数量和单 Token 激活参数量是两回事。总参数量主要体现模型容量,激活参数量更接近单次前向计算的实际成本。
研究重点包括 Routing 策略、负载均衡、Expert 专业化、跨设备通信、训练稳定性和推理部署。理论上看起来很美好,实际做起来经常遇到某些 Expert 特别忙、某些 Expert 几乎不工作,以及跨卡通信把计算收益吃掉的问题。
3. 长序列架构
这个方向主要研究如何处理书籍、代码仓库、长视频、科研文献和长期交互记录。主要方法包括位置编码外推、递归 Memory、历史信息压缩、分层 Attention、局部—全局 Attention 和流式序列处理。
这里有一个很容易混淆的点:Context Window 很长,只能说明模型可以接收很多 Token,并不能直接说明模型能够稳定利用这些信息。真正困难的是在几十万甚至几百万 Token 中找到相关证据,并完成跨段落、跨文档推理。
4. 状态空间模型与混合架构
Mamba 等 State Space Models(SSMs)在理论上能够以接近线性的复杂度处理长序列,因此在长文本和流式输入场景中受到很多关注。相关研究主要关注其长序列建模能力、训练稳定性、信息回溯能力,以及与 Attention 模块结合的 Hybrid Architecture。
目前比较现实的路线往往是混合使用 SSM 和 Attention,因为 Attention 在精确读取上下文信息方面仍然很强,而 SSM 在长序列效率上更有优势。
5. Summary
这个方向的核心目标,是让模型在相同计算预算下获得更大的有效容量、更长的序列建模能力和更高的硬件利用率。至于 Transformer 什么时候会被真正替代,现在下结论还比较早。至少从目前来看,Transformer 仍然活得挺好。
相关文献:
- Vaswani et al., Attention Is All You Need, NeurIPS 2017
- Fedus et al., Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity, JMLR 2022
- Dao et al., FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness
- Gu & Dao, Mamba: Linear-Time Sequence Modeling with Selective State Spaces
03 Post-training and Alignment
这个方向研究模型完成 Pre-training 之后,还要怎么继续训练,才能从一个会续写文本的模型,变成一个能听懂指令、完成任务、控制输出的助手。
Pre-training 阶段通常使用 Next Token Prediction,让模型从海量文本中学习语言规律、事实知识、代码模式以及一定程度的推理能力。但模型学会这些内容之后,未必知道用户想要什么,也未必能够稳定遵循指令和安全规范。所以,模型在完成 Pre-training 之后,通常还要经过 SFT、Preference Learning、AI Feedback、强化学习和知识蒸馏等后训练阶段。
相关的二级方向主要有:
1. Supervised Fine-Tuning
SFT 主要使用“指令—回答”、任务说明、代码样本和多轮对话等监督数据进行训练,让模型学会 Instruction Following、格式控制、任务分解和基本对话规范。这个方向看起来最成熟,实际上数据构造一直很卷。比如任务类型怎么组合,简单样本和困难样本怎么配比,长回答和短回答如何混合,推理过程应该展示到什么程度,以及不同领域是否需要单独设计训练数据。
有些 Reasoning Model 还会在强化学习之前加入 Cold Start,用高质量的数学、代码、长推理和工具调用数据,先让模型学会基本的解题和执行方式。所以 SFT Data Curation 本身也是一个重要方向。很多时候,少量高质量数据的效果会比大量普通数据更好。模型自动生成 SFT 数据虽然可以节省人工成本,但也可能造成错误重复、风格单一和数据多样性下降。
2. Preference Alignment and AI Feedback
Preference Alignment 主要研究如何让模型更倾向于生成评价者认为更好的回答。RLHF 的经典流程一般是先收集人类偏好数据,再训练 Reward Model,最后使用 PPO 等强化学习方法优化语言模型。DPO 则把 Preference Optimization 改写成一种相对直接的训练目标,在原始设定下不需要单独训练 Reward Model,训练成本通常也更低。
除此之外,还有 IPO、KTO、SimPO 和 Online Preference Optimization 等方法,分别从目标函数、偏好数据形式和在线采样等方面进行改进。RLAIF 则使用 AI 模型提供反馈,Constitutional AI 进一步让模型根据预先设定的原则,对回答进行批评、修改和排序。这类方法可以大规模生成反馈数据,减少人工标注成本。
这条线路一直很依赖评价标准本身。标注者喜欢什么、Preference Pair 如何构造、Reward Model 如何打分、AI Judge 是否存在偏差,都会影响模型最后的行为。比较常见的问题包括 Reward Hacking、过度迎合、回答越来越长,以及模型为了获得高评价而形成固定表达套路。有些模型看起来更“会说话”了,事实性和独立判断能力却可能下降。
3. Reasoning-oriented Reinforcement Learning
这个方向主要研究如何通过强化学习提升模型在数学、代码、逻辑推理和形式化证明等任务上的能力。RLVR,也就是 Reinforcement Learning with Verifiable Rewards,通常会让模型针对同一个问题生成多条解答,再通过程序、测试用例、数学答案或形式化验证器判断结果是否正确,最后用这些奖励更新模型。
GRPO 会比较同一个问题下多条回答的相对奖励,从而减少对 Value Model 的依赖。DAPO 则针对长链推理中的采样效率、策略更新和长度控制等问题继续做改进。这条线路的重点,是让模型通过反复尝试找到更有效的推理策略。模型可以在多次采样和奖励反馈中逐渐发现新的解题路径,Rejection Sampling、Best-of-N 和 Iterative SFT 也经常和这类训练流程结合使用。
难点主要在 Reward 和 Verifier。模型可能学会钻验证器的空子,推理过程可能越来越长,最终答案正确也不代表中间过程可靠。数学和代码比较容易验证,开放式问答、复杂决策和现实世界任务就困难得多。
4. On-Policy Distillation and Strong-to-Weak Transfer
OPD 主要研究如何把强模型的能力迁移给更小的 student 模型。传统 Knowledge Distillation 经常让 student 拟合 teacher 提前生成好的固定文本,训练时看到的轨迹和实际生成时的轨迹可能存在差异。OPD 则让 student 先按照自己的当前策略生成回答或推理过程,再由 teacher 在这些 student-generated trajectories 上提供 soft target,例如 token-level probability distribution,并通过 Reverse KL 等目标进行训练。
这样 student 学习到的就不只是某一条固定答案,还包括 teacher 对不同候选 token 的概率判断。直观上,模型生成时不容易出现强行贴着固定轨迹走的感觉,也有助于减轻 Exposure Bias,改善长文本生成和 Calibration。MiniLLM 和 GKD 是这一方向的代表性工作。现在 Strong-to-Weak Transfer 也经常采用类似思路,把强模型的推理、工具调用和 Agent 能力迁移到规模更小、推理成本更低的模型中。
这个方向的实际难点包括 teacher 推理成本、teacher 和 student 之间的能力差距,以及 student 能否真正学到推理能力,而不只是模仿 teacher 的表达方式。
5. Parameter-Efficient Fine-Tuning
LoRA、Adapter、Prompt Tuning 等方法只更新少量参数,可以明显降低模型适配的计算、显存和存储成本。这个方向对开源模型和企业落地很重要。大多数团队没有条件重新训练整个模型,只能在已有模型上进行轻量适配。不同任务还可以分别保存不同的 Adapter,部署时按需加载。
进一步的研究包括 Adapter Composition、个性化模型、用户偏好建模和 Continual Alignment。这里会涉及隐私、用户偏好变化、灾难性遗忘,以及模型会不会为了迎合用户而降低事实性。PEFT 主要解决的是模型适配成本问题,可以和 SFT、DPO、OPD 等多种训练方法结合。
6. Summary
Post-training 决定了模型最终会以什么方式使用预训练阶段获得的能力。SFT 让模型学会遵循指令,Preference Alignment 让模型更符合评价标准,AI Feedback 扩大了反馈数据的来源,Reasoning RL 尝试提升复杂推理能力,OPD 负责迁移强模型的能力,PEFT 则降低了模型适配成本。Pre-training 更像是在给模型打基础,Post-training 则是在决定这些基础能力最后如何被调用。当然,后训练无法凭空补出预训练阶段完全没有学到的知识和能力,这一点还是要注意。
相关文献:
- Ouyang et al., Training Language Models to Follow Instructions with Human Feedback
- Bai et al., Constitutional AI: Harmlessness from AI Feedback
- Rafailov et al., Direct Preference Optimization
- Hu et al., LoRA: Low-Rank Adaptation of Large Language Models
- Gu et al., MiniLLM: On-Policy Distillation of Large Language Models
- Agarwal et al., On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes
- Shao et al., DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- DeepSeek-AI, DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- Yu et al., DAPO: An Open-Source LLM Reinforcement Learning System at Scale
- Qwen Team, Qwen3 Technical Report
04 Reasoning, Verification and Planning
这个方向主要研究大模型如何处理需要多步推导的问题,包括数学、代码、逻辑、科学推理和复杂任务规划。普通问答可能一次生成就够了,但复杂问题往往需要模型保持前提一致、拆分子问题、发现中间错误,并根据反馈重新调整后续步骤。链条一长,前面一个小错误就很容易一路传到最后,所以 Verification 现在越来越重要。
相关的二级方向主要有:
1. Chain-of-Thought
Chain-of-Thought 的基本思路是让模型显式生成中间推理步骤。常见扩展包括问题分解、Self-Consistency、多路径采样、Tree-of-Thought 和 Graph-of-Thought 等。Self-Consistency 通常会生成多条推理路径,再通过投票选择最终答案。Tree Search 则会在不同中间状态之间进行扩展、评分和剪枝。
需要注意的是,模型写出来的 Chain-of-Thought 不一定完整对应内部计算过程。有时模型已经倾向于某个答案,再生成一套看起来合理的解释。因此 CoT 很适合辅助求解和检查,但不能直接当成模型内部机制的忠实记录。
2. Process Supervision and Verifier
结果监督只关心最终答案对不对,Process Supervision 会进一步评价每个中间步骤。常见方法包括 Process Reward Model、Outcome Reward Model、代码执行器、数学验证器和形式化证明器。有了 Verifier 之后,模型可以生成多个候选答案,再筛选出分数较高的结果,也可以在推理过程中提前终止错误路线。
不过 Verifier 自己也会错,尤其是面对很长、写得很像正确答案的推理时,可能出现 Overcredit,也就是给错误步骤过高评价。
3. Test-Time Scaling
这个方向最近几年很热,基本思想是在推理阶段多花一些计算资源,比如增加采样次数、进行搜索、反思、回溯或者调用 Verifier。已有研究表明,Test-Time Compute 的收益与题目难度、基础模型能力和验证器质量密切相关。对基础模型本来就有一定成功率的问题,多采样和搜索通常比较有效。
简单问题上想太多,反而可能把正确答案改错;特别困难的问题上,如果模型完全没有有效解题能力,多采样也可能只是重复错误。
4. Reinforcement Learning for Reasoning
数学、代码和形式逻辑比较适合做 Reasoning RL,因为答案通常能够自动验证。例如代码可以运行测试,数学题可以检查最终结果,形式化证明可以交给 Theorem Prover 验证。这样就可以构造相对明确的 Reward Signal。开放式现实问题会更困难,因为最终答案往往没有唯一标准,自动验证也不可靠。所以目前 Reasoning RL 最明显的进展,通常还是出现在数学、代码和可验证任务上。
5. Summary
这个方向正在把传统的一次性生成,扩展成“提出候选方案—验证—回退—继续搜索”的完整求解过程。个人感觉,未来 Reasoning 的重点可能会越来越偏向 Verifier、Search 和 Tool Integration,单纯让模型输出更长的 CoT,收益迟早会遇到瓶颈。
相关文献:
- Wei et al., Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
- Lightman et al., Let's Verify Step by Step
- Snell et al., Scaling LLM Test-Time Compute Optimally Can Be More Effective Than Scaling Model Parameters
- DeepSeek-AI et al., DeepSeek-R1: Incentivizing Reasoning Capability in Large Language Models
05 Knowledge, Retrieval, Long Context and Memory
这个方向主要研究模型如何使用外部知识、处理长篇资料、保存历史信息,以及怎样减少 Hallucination。大模型参数本身可以存储大量知识,但这些知识更新成本很高,来源也不容易追溯。模型训练完成之后发生的新事件,通常也不会自动进入参数中。因此一个很自然的思路,就是让模型在回答问题时访问外部知识库、搜索引擎或者长期 Memory。
相关的二级方向主要有:
1. Retrieval-Augmented Generation
RAG 的典型流程是先检索,再生成。系统先从文档库、数据库、搜索引擎或 Knowledge Graph 中找到相关内容,然后把检索结果放进 Context,让模型基于这些材料回答问题。研究内容包括 Query Rewrite、Dense Retrieval、Sparse Retrieval、Hybrid Retrieval、Reranking、多跳检索、引用对齐,以及 Retriever 和 Generator 的联合训练。
RAG 确实可以提高知识时效性和可追溯性,但它无法自动保证事实正确。Retriever 找错文档、Reranker 排错顺序、知识库被污染,或者 Generator 没有正确使用证据,最后都会出问题。
2. Long Context
Long Context 主要研究模型如何一次处理大量 Token,比如整本书、几十篇论文、完整代码仓库或者长期聊天记录。常见方法包括位置编码外推、Context Compression、分层 Attention、局部—全局 Attention 和训练长文本数据。
这里最重要的区分是 Context Window Length 和 Effective Context Length。模型能接收一百万 Token,不代表它能够稳定找到并组合其中所有重要信息。“Lost in the Middle”一类研究发现,关键信息位于长文本中间时,模型性能可能明显下降。这个问题到现在也没有完全解决。
3. Long-term Memory
Agent 的 Memory 一般会保存用户偏好、任务经验、历史事件和中间结果,再在未来任务中进行检索。研究问题包括:什么信息值得记忆,什么时候写入,怎样检索,什么时候删除,以及发现旧记忆错误后如何修正。
实际系统中还要考虑隐私。如果模型把一次性的用户信息、错误理解或者敏感数据永久保存下来,后续可能产生很麻烦的问题。
4. Knowledge Editing and Hallucination Mitigation
Knowledge Editing 研究如何直接修改模型中的局部事实,比如某个实体属性发生变化,希望只更新对应知识,同时尽量不影响其他内容。Hallucination Mitigation 则包括置信度估计、事实核验、自我检查、引用约束、RAG 和外部 Verifier 等方法。
这两个方向都挺难。局部改一个事实,可能影响相关知识;让模型自我检查,也可能出现同一个模型重复确认自己的错误。
5. Summary
这个方向的目标,是让模型获得更及时、可更新、可追溯的知识,同时能够保存长期任务所需的信息。RAG、Long Context 和 Memory 经常被放在一起讨论,但它们解决的问题并不完全一样:RAG 偏向外部知识获取,Long Context 偏向单次输入容量,Memory 偏向跨时间的信息保存。
相关文献:
- Lewis et al., Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks, NeurIPS 2020
- Asai et al., Self-RAG: Learning to Retrieve, Generate, and Critique through Self-Reflection
- Liu et al., Lost in the Middle: How Language Models Use Long Contexts, TACL 2024
- Packer et al., MemGPT: Towards LLMs as Operating Systems
Agent 这几年基本已经单独长成一个大方向了。一个典型的 LLM Agent 通常会包含 Environment Observation、Planning、Tool Use、Memory、Feedback 和 Plan Revision 等环节。简单理解,就是模型不再只输出一段文本,还可以搜索网页、调用 API、运行代码、操作软件,甚至控制机器人。
相关的二级方向主要有:
这个方向研究模型如何理解工具说明、选择正确的工具、填写参数,并根据返回结果继续完成任务。训练方法包括人工操作轨迹、合成 Tool-Use 数据、Imitation Learning 和 Reinforcement Learning。
实际问题通常比论文 Demo 麻烦很多,比如 API 发生变化、返回异常、参数格式错误、权限不足,以及模型调用了一个看起来相关但其实不合适的工具。Toolformer 等工作研究模型如何自动学习什么时候调用工具,后来的 Function Calling 则逐渐成为实际产品中的标准能力。
2. Planning, Reflection and Execution
ReAct 把 Reasoning 和 Acting 交替进行,让模型根据环境反馈不断更新计划。其他方法还会加入 Task Decomposition、Reflection、Search、Backtracking 和 Dynamic Replanning。长任务中的主要问题包括初始计划错误、状态记录混乱、执行到一半偏离目标,以及模型口头上说“任务已完成”,实际上并没有完成全部步骤。所以现在 Agent 评测越来越关注真实 Task Success,而不是只看模型生成的计划听起来是否合理。
3. Computer Use and Embodied Agents
Computer-Use Agent 通过截图、鼠标、键盘和界面元素操作网页或桌面软件。Embodied Agent 则进一步连接机器人传感器和执行器,需要理解真实环境并执行物理动作。网页和软件界面会持续变化,按钮位置、页面结构和弹窗都不固定;机器人环境还会出现视觉噪声、延迟、碰撞和不可逆操作,所以这个方向的可靠性要求很高。看 Demo 经常很惊艳,真做 Benchmark 的时候成功率就会迅速回归现实。
4. Multi-Agent Systems
多 Agent 系统通常会让不同模型分别担任 Planner、Executor、Critic、Reviewer 或者领域专家。理论上的优势是可以分工、交叉验证和增加视角。实际问题包括通信成本、信息重复、角色混乱和错误传播。多个 Agent 也可能一起相信同一个错误,然后互相增强信心。因此 Agent 数量增加,并不会自动带来更高的系统能力。
比较关键的研究问题是角色如何划分、信息是否独立、什么时候需要讨论,以及最终由谁负责验证结果。
5. Summary
Agent 研究的重点正在从“模型能不能调用工具”,转向“模型能不能在开放环境中长期、可靠、可恢复地完成任务”。Planning、Memory 和 Tool Use 都很重要,但权限控制、异常恢复和任务验证,可能才是实际系统里最难处理的部分。
相关文献:
- Yao et al., ReAct: Synergizing Reasoning and Acting in Language Models
- Schick et al., Toolformer: Language Models Can Teach Themselves to Use Tools
- Guo et al., Large Language Model Based Multi-Agents: A Survey of Progress and Challenges, IJCAI 2024
- Xie et al., OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments
07 Multimodal Models and World Models
多模态方向主要研究如何统一处理文本、图像、语音、音频、视频、3D 信息和动作。目前常见做法是使用 Vision Encoder 或者 Audio Encoder 提取特征,再通过 Projection Layer、Cross-Attention 或者统一 Token 表示接入语言模型。最终目标当然是希望模型能够像人一样,同时理解语言、视觉、声音和现实环境。不过这个目标目前还挺远的,先把图表和空间关系看明白就已经不容易了。
相关的二级方向主要有:
1. Vision-Language Understanding
主要任务包括 Visual Question Answering、Image Captioning、Document Understanding、Chart Reasoning、GUI Understanding、Visual Grounding 和 OCR。目前模型对普通图片描述已经做得不错,困难主要集中在细粒度识别、物体数量、空间关系、复杂图表和高密度文档。另外一个问题是模型经常对看不清的内容给出非常确定的回答,因此视觉不确定性表达也是值得研究的方向。
2. Speech and Omni Models
这个方向尝试把 Automatic Speech Recognition、声音理解、语言推理和 Text-to-Speech 整合到一个统一模型中。研究内容包括低延迟交互、实时打断、说话人识别、口音适应、情绪信息、背景噪声和语音生成自然度。Omni Model 的理想状态是直接对语音、图像、视频和文本进行联合理解与生成,而不需要多个独立模块串联。实际部署还会涉及语音隐私、声音克隆和身份冒用等安全问题。
3. Image, Video and Audio Generation
这部分包括图像生成、视频生成、音频生成、跨模态编辑和可控内容生成。图像方向已经相对成熟,视频方向仍然在卷运动一致性、人物一致性、镜头控制、长时间叙事和音画同步。除了生成质量之外,还有版权、Watermark、Content Provenance 和 Deepfake Detection 等问题。个人感觉这里的产品进展经常比论文分类还快,过一段时间回头看,Benchmark 可能已经落后模型能力一截了。
4. 3D Spatial Intelligence and World Models
这个方向研究模型对 3D 空间、物体关系、运动规律和动作后果的理解。World Model 一般希望学习环境状态和状态转移规律,使模型能够预测“执行某个动作之后会发生什么”,进而支持规划、模拟和机器人控制。需要注意,生成一段看起来符合物理规律的视频,与真正掌握稳定的物理和因果模型之间仍然存在明显距离。
5. Summary
多模态研究的核心问题,是如何建立不同模态之间稳定、精确,并且具有时间和空间一致性的表示。当前模型已经能连接语言、图像和声音,但 Grounding、空间推理、物理一致性和长期视频理解仍然是比较明显的短板。
相关文献:
- Wu et al., Multimodal Large Language Models: A Survey
- Alayrac et al., Flamingo: A Visual Language Model for Few-Shot Learning, NeurIPS 2022
- Driess et al., PaLM-E: An Embodied Multimodal Language Model
- Brohan et al., RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
08 Efficiency, Systems and Deployment
这个方向主要研究如何降低大模型训练和推理成本。虽然很多工作看起来更像 Systems 或者 MLSys,但它们直接决定一个模型能不能训练出来、能不能部署,以及普通用户能不能承担推理成本。评估效率时也不能只看 Tokens per Second,还需要考虑 Latency、Throughput、显存、能耗、并发能力和模型质量。
相关的二级方向主要有:
1. Distributed Training
大模型通常无法放在单张 GPU 上,因此需要 Data Parallelism、Tensor Parallelism、Pipeline Parallelism、Expert Parallelism 和 ZeRO 等技术。研究重点包括如何切分参数、梯度和 Optimizer State,如何减少跨设备通信,以及设备发生故障后怎样恢复训练。模型规模扩大之后,集群利用率非常关键。几千张卡同时训练时,即使只有几个百分点的空闲,也可能对应相当可观的成本。
2. Model Compression
常见方向包括 Quantization、Pruning 和 Knowledge Distillation。Quantization 会把权重或 Activation 从 FP16、BF16 降低到 INT8、INT4 甚至更低精度。Pruning 删除影响较小的参数,Distillation 则让小模型模仿大模型的输出或者中间表示。压缩之后的平均 Benchmark 分数可能变化不大,但长尾知识、复杂推理和安全行为有时会出现更明显的退化,所以只看平均准确率通常不太够。
3. Inference and Serving
推理系统研究包括 Continuous Batching、KV Cache 管理、Prefix Caching、Operator Fusion 和 Speculative Decoding。vLLM 的 PagedAttention 主要解决动态 KV Cache 造成的内存碎片和重复存储问题,从而提高并发和吞吐。长上下文和 Agent 会进一步放大 KV Cache 压力,因为每个请求可能持续很久,还要保存大量历史信息。这个方向常见的情况是,模型算法没变,系统优化之后服务能力直接提高几倍,MLSys 的含金量还是很高的。
4. On-device LLM and Green AI
On-device LLM 研究如何在手机、汽车、可穿戴设备和其他边缘设备上运行模型。优势包括隐私性、离线能力和低网络延迟,主要限制来自设备内存、带宽、功耗、散热和电池容量。进一步的方向是模型、Compiler、Kernel 和 AI 芯片协同设计,也就是不要只在模型训练完之后再考虑部署问题。
5. Summary
这个方向的目标,是在尽量保持模型能力的前提下,提高训练、推理和服务过程的资源利用率。说得直接一点,同样的钱、同样的卡、同样的电,谁能训练更多模型、服务更多请求,谁就有明显优势。
相关文献:
- Wan et al., Efficient Large Language Models: A Survey, TMLR
- Kwon et al., Efficient Memory Management for Large Language Model Serving with PagedAttention, SOSP 2023
- Frantar et al., GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers
- Leviathan et al., Fast Inference from Transformers via Speculative Decoding
09 Evaluation and Interpretability
这个方向主要研究怎么判断一个模型到底好不好,以及模型内部为什么会产生某种行为。Benchmark 看起来很直观,实际坑很多。测试题可能进入训练集,Prompt 模板会影响结果,选择题分数也不一定能反映真实工作能力。所以现在的评测逐渐从单一准确率,转向多任务、多指标、动态数据和完整系统评测。
相关的二级方向主要有:
1. Capability and Reliability Evaluation
除了知识、数学、代码和推理能力,现在还会评估 Calibration、Robustness、Fairness、Bias、Toxicity 和 Efficiency。HELM 比较重要的一点,是推动在统一场景下使用多个指标评估模型,避免只看 Accuracy。为了减少 Data Contamination,研究者也开始使用动态题库、私有测试集和持续更新的 Benchmark。不过只要 Benchmark 公开时间足够长,后续训练数据就可能逐渐包含这些题目,所以这个问题很难彻底解决。
2. Human Evaluation and LLM-as-a-Judge
Chatbot Arena 通过匿名成对比较收集用户偏好,比较适合开放式对话评测。LLM-as-a-Judge 则用另一个模型评价回答质量,成本低、扩展快,现在已经非常常见。问题是 Judge 会受到答案顺序、长度、写作风格和模型同源性的影响。比如更长、更自信、格式更漂亮的答案,有时更容易获得高分,即使事实质量并没有更好。因此很多研究会做 Position Swap、多 Judge 投票和人工校准。
3. Agent and System Evaluation
Agent 评测不能只看它生成的计划,需要检查任务有没有真正完成、工具调用是否正确、失败之后能否恢复,以及花费了多少时间和费用。还要评估有没有越权、有没有泄露信息、是否执行了多余操作。真实环境会不断变化,所以 Agent Benchmark 的可重复性比静态问答困难很多。一个网页更新按钮位置,就可能直接影响模型成功率。
4. Mechanistic Interpretability
Mechanistic Interpretability 尝试分析模型内部的特征表示和计算过程。常见方法包括 Probing、Activation Patching、Causal Tracing、Sparse Autoencoder 和 Circuit Analysis。Sparse Autoencoder 希望把神经网络中混合在一起的 Activation 分解成相对可解释的 Feature。不过找到一个与某个概念相关的 Feature 只是第一步,还需要通过干预实验验证它是否真的具有因果作用。相关性和因果性在这里仍然需要分得很清楚。
5. Summary
这个方向最终想解决的问题,是怎样建立能够预测真实使用表现、识别失败条件,并支持公平比较的评测体系。榜单当然有用,但一个模型在榜单上领先,并不意味着它在所有真实任务上都更好。尤其是 Agent、医疗和法律等场景,系统级评测通常比几套选择题更重要。
相关文献:
- Liang et al., Holistic Evaluation of Language Models, TMLR 2023
- Chiang et al., Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference, ICML 2024
- Shu et al., A Survey on Sparse Autoencoders: Interpreting the Internal Mechanisms of Large Language Models, Findings of EMNLP 2025
- Xu et al., Data Contamination for Large Language Models: A Survey
10 Safety, Privacy, Security and Governance
这个方向现在也已经非常大了,研究范围包括模型本身会产生什么风险、攻击者怎样利用模型,以及部署方应该如何控制权限和责任。随着模型从聊天工具逐渐变成能够调用工具的 Agent,安全问题也从“会不会生成有害文本”,扩展到了“会不会执行有害操作”。
相关的二级方向主要有:
1. Alignment Safety and Red Teaming
这一块主要研究有害内容、欺骗、偏见、过度迎合、危险能力和拒答边界。常用方法包括安全 SFT、Preference Training、输入输出分类器、对抗测试和 Red Teaming。实际难点是安全和可用性之间的平衡。限制太少容易产生风险,限制太多又会导致正常问题被拒答。另外,模型在 Benchmark 里拒绝危险请求,并不能保证换一种表达方式之后仍然安全,所以对抗测试需要不断更新。
2. Jailbreak and Prompt Injection
Jailbreak 主要尝试绕过模型本身的安全约束。Prompt Injection 则更偏系统安全,比如恶意指令被隐藏在网页、邮件或文档里,Agent 读取之后可能把它当作任务要求,进而泄露数据或调用工具。防御方法包括隔离不可信内容、最小权限、工具参数验证、关键操作确认和完整审计。个人感觉 Prompt Injection 会长期存在,因为只要模型同时读取“数据”和“指令”,两者之间就很难始终保持清晰边界。
3. Privacy, Memorization and Copyright
大模型可能记忆训练文本、个人信息、代码和受版权保护的内容,并在特定 Prompt 下复现。相关研究包括 Differential Privacy、数据去重、Membership Inference 防御、Training Data Extraction、Machine Unlearning 和内容溯源。版权研究还会关注训练数据来源、Fair Use、授权机制、输出相似性和模型生成内容的归属问题。这个方向技术问题和法律问题交叉得很深,不同国家和地区的规则也不完全一样。
4. Fairness, Social Impact and Governance
这一块关注不同语言、文化、性别和社会群体之间的性能差异,以及大模型对教育、就业、公共信息和高风险决策的影响。治理框架一般强调明确使用场景、识别风险、记录数据和模型信息、持续评测,并在部署后进行监控。NIST AI RMF 等框架会从 Govern、Map、Measure 和 Manage 等角度组织风险管理工作。
5. Summary
大模型安全很难靠单一方法解决。模型、训练数据、Prompt、外部工具、权限系统、用户界面和组织流程都会影响最终风险。模型层面的对齐很重要,系统层面的隔离、确认和审计同样重要。
相关文献:
- Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile
- Carlini et al., Extracting Training Data from Large Language Models, USENIX Security 2021
- Xu et al., Data Contamination for Large Language Models: A Survey
- OWASP Top 10 for Large Language Model Applications
11 Domain-specific LLMs and AI for Science
最后一个大方向是专用大模型和 AI for Science。通用模型覆盖面很广,但到了医疗、法律、金融、科研和大型软件工程场景,通常还需要更准确的专业知识、工具、规则和评测标准。因此这个方向研究的不只是领域数据微调,还包括专业工具集成、可验证推理和真实工作流评测。
相关的二级方向主要有:
1. Code LLMs
Code LLM 研究代码生成、自动补全、测试生成、Debug、Code Review 和大型代码仓库理解。代码领域有一个很大的优势,就是很多结果可以自动验证。代码能不能编译、能不能通过测试、执行结果对不对,都可以转化成相对明确的 Reward Signal。目前难点主要包括跨文件依赖、长期任务规划、需求理解、安全漏洞和私有代码库适配。单个函数生成已经相对成熟,真正困难的是理解整个 Repository 并持续完成多步骤开发任务。
2. Mathematical Reasoning and AI for Science
这个方向包括数学证明、科学文献分析、假设生成、材料设计、药物发现、蛋白质研究和实验规划。模型通常会连接 Theorem Prover、数值计算工具、模拟器、科学数据库和实验设备。目前相对可靠的路线,一般还是模型提出候选方案,再由专业工具、形式化系统或者真实实验进行验证。让模型自动生成一个看起来合理的科学假设并不算太难,证明它真的正确才是主要问题。
3. Medical, Legal and Financial LLMs
医疗、法律和金融领域的共同特点是专业术语多、规则复杂,并且错误代价高。Med-PaLM 等研究表明,专业数据适配可以明显提高领域任务表现,但医学考试成绩无法直接代表临床使用安全。相关研究需要加入真实工作流评测、引用来源、Calibration、隐私保护、专家监督和责任划分。法律和金融也类似,模型需要处理地区差异、规则更新和时效性,不能只依赖参数中已有的旧知识。
4. Multilingual and Low-resource Languages
网络训练数据的语言分布非常不平衡,英语数据远多于大多数语言,因此模型在不同语言上的能力差异很明显。研究方向包括 Cross-lingual Transfer、平衡采样、Tokenizer 优化、本地文化评测和社区参与。简单地把英语训练数据翻译成其他语言,可能会丢失文化语境、引入翻译偏差,并产生很明显的翻译腔。低资源语言还会遇到数据不足、标准书面语缺失和评测集匮乏等问题。
5. Summary
专用模型研究的目标,是把大模型接入具有明确知识边界、专业工具、验证机制和责任体系的真实工作流程。个人感觉这个方向未来会越来越重要。通用模型提供基础能力,真正落地时往往还是要结合领域数据、专业工具和人工审核。
相关文献:
- Qin et al., A Survey of Multilingual Large Language Models, Patterns
- Singhal et al., Large Language Models Encode Clinical Knowledge, Nature 2023
- Zan et al., Large Language Models Meet NL2Code: A Survey
- Wang et al., Scientific Discovery in the Age of Artificial Intelligence, Nature 2023
再随手补几篇整体性综述:
- Zhao et al., A Survey of Large Language Models(2026 更新版)
- Minaee et al., Large Language Models: A Survey
- Wan et al., Efficient Large Language Models: A Survey
- Wu et al., Multimodal Large Language Models: A Survey
以上,欢迎补充和纠正。
原文作者:白露未晞me,已获作者授权发布。来源: https://www.zhihu.com/question/1958561146647876509/answer/2075524312644195693