LLM 的甜区与边界
大语言模型 LLM 这条路能走得通,并不是因为模型真正理解了世界,而是人类的感知对世界有极大的容错率。早期机器翻译的商用逻辑就很朴素:以 Google 翻译为代表的路线并不追求理解语言,只要大多数人挑不出毛病,翻译就算成立;至于咬文嚼字者看出的那些丢失,直接放掉,因为机器学习的方法根本无法优化到完美。基于 Transformer 架构的 LLM 在这一点上与它很像:在面向人类感知的任务里,精度极限往往不取决于它是否真正建模了世界动力学,而取决于它能否越过人的感知阈值。统计意义上把大多数人的眼睛糊弄过去,任务就算完成。
这也划出了 LLM 的甜区:它的底层目标就是预测下一个/下一组 token。凡是可以被表述为 token 序列的东西,都能被高效地学习、再产出,并且对人眼感知的效果极好:翻译、输出代码、编写文章,乃至 token 化之后的音视频生成,都为我们带来了不少惊喜。
但边界也在这里:基于概率预测的模型并不能真正建模世界动力学,它擅长的是给出一个“说法”,而不是给出一个“控制律”。人的感知时间分辨率远低于机器,体验世界像看一场低帧率电影:电光火石被忽略,偶尔出界也无伤大雅;同一句话正说反说,意思到了就都能接受。但是机器以晶振、时钟周期乃至原子钟为时间尺度,它并不关心语言是否优美动人,只关心下一拍的输入是否准时到达、输出是否落在约束内。在这里,模糊的概率生成是行不通的。
比如“7.9 和 7.11 哪个大”,不少模型会在小数比较上翻车,或者“雷霆大思考”花几万 token 输出一行结论;这件事交给两行 Python 反而确定得多。靠概率采样可以糊弄人,却糊弄不了机器。机器的控制回路是严丝合缝的闭环,它要的是精确的偏差、确定的增益,而不是一段听起来合理的自然语言。和机器打交道,只能老老实实求控制律;拿不到稳定的控制律和反馈增益,一切等于零。
量化交易常被说成“依靠AI”,但真正依靠的不是 LLM 本身,而是它辅助写出的代码、找出的因子,是那些能被硬约束、能进控制矩阵的东西,而不是让 LLM 直接判断价格、吐出买还是卖。概率生成的结论,糊弄人眼可以;拿它去驱动机器等于送死。
我们需要的是让确定性的东西去驱动确定性的世界,LLM 的定位应该是做工具的生产者,而不是代替工具进入反馈环驱动世界。这也是我在之前一篇随想中表达过的:Transformer 架构是好用的,但我觉得它实现不了 AGI。我相信总有一天,人类发明的人工智能能够真正理解世界,而不是基于概率预测,但现在机房里轰鸣运行着的那个 GPT 或 Claude,真的办不到。