上半年的预测与下半年的猜想
上半年在即刻发表了一些暴论,对大模型训练的发展方向、交互方式都做了些“畅想”,回看发现不少想法已然被实现。尤其是在上周Kimi K2发布后,回看时突然发现很多核心思想和3/22的这篇“不谋而合”。更后悔当年没做大模型算法了,当然如果有这方面的产品机会也可以联系(开个小玩笑)。想结合这篇帖子,对下半年模型的发展趋势胡乱猜想一番。
其实模型的能力(完全通过模型的输出实现)和发展趋势,仍然可以总结为3/22帖子中提到的两点,因为这也是新数据的生成方式:
-
模型和人的交互:纯文本 → Markdown格式的文本 → 前端页面的GUI
-
模型和世界的交互:纯文本 → 工具调用
截止目前,回过头来看看模型过去的发展节奏,似乎都符合这个“范式”:人们使用模型的方式 → 生产了新能力和模型的交互数据 → 数据作为语料被模型内化成为新模型
【Stage1】模型内化文本:人和模型对话 → “对话型”大语言模型(ChatGPT、GPT3.5等)
【Stage2】模型内化CoT:人构建Prompt(CoT)作为模型的输入从而得到更好的结果 → 生产大量的带有CoT的数据 → “推理型”大语言模型(GPT o系列、DeepSeek R1等)
【Stage3】模型内化工具调用:人构建Workflow使模型可以调用工具完成任务 → 生产大量的带有工具调用的数据 → “Agentic型”大语言模型(Claude 4、Kimi K2等)
而每一次模型“范式”的进步所产生的数据,都可以进一步的作为“语料”,训练出更强的“base model”。当前【Stage3】其实也才刚刚起步,但这个阶段迭代时间在快速缩短,核心原因是当前不仅仅人能产生数据了,模型自身也可以生成可用的“合成数据”了,甚至比人生产的数据质量更高,例如Kimi K2就是通过这种方式来训练了,让一个Agent模拟用户使用工具,生成模型使用工具的数据。在有了“人的生产数据”+“模型的合成数据”后,下半年比较明显的一大趋势是,模型Agent相关的能力会越来越强,目前还会经常遇到的一些问题,如“工具调用出错”、“工具调用准确率低”等,可能下半年(比如在GPT-5发布后)被解决。
那么接下来不妨再往更远的方向看看,【Stage4】可能会是什么呢?不妨先看看我们现在人们在用模型构建什么 —— 在构建系统的上下文,且越来越“系统化”的构建上下文。为了进一步提升模型和人交互、和世界交互的广度和深度:
-
模型和人的交互:纯文本 → Markdown格式的文本 → 前端页面的GUI → 带有完整前、后端的GUI(现在已经有大模型公司这么做了,例如MiniMax的Agent)
-
模型和世界的交互:纯文本 → 工具调用 → 复杂环境下的多工具调用(可能是操作系统级别的)
以下为纯个人的“猜想”:【Stage4】可能会是模型内化系统上下文:人构建上下文使模型可以完成更复杂的任务 → 生产大量的带有系统上下文的数据 → “Systematic型”的大模型。即模型能作为操作系统,完成操作系统级别的复杂交互。你给他的上下文越多,他能干的越多。换句话说,限制模型能力的已经不再是模型能力,而是在传统工程系统中的“AI渗透率”。
那模型到时候能干什么?想一想,给你了mac/window,你在做什么呢?