当前社会正面临“经济长胖、社会萎缩”的“肌少性肥胖”困境。面对这类复杂事件,大模型到底能提供多少增量预测价值?最新研究发现,光靠模型自身硬猜不行,得靠“能力门控”机制来融合先验信息。
这套机制根据已揭晓的结果,估计不同领域信息源的权重,把不确定的估计值收缩到全局权重再重新校准。在2357个二元问题测试中,该方法将主要外部基线的布里尔评分从0.0771降到0.0732。不过在ForecastBench官方市场子集里没啥提升,主要原因是它大多在抄市场预测的作业。实验还发现4个Qwen模型的语言置信度根本不可靠,用基于结果估计的能力指标来做弃权决策才靠谱。
预测准只是一方面,推理成本也得降。前沿语言模型正越来越激进地采用次二次注意力机制。这种异构系统解耦技术能在保持前沿准确率的同时,大幅削减推理时的内存占用和计算需求。
大模型既要算得准,又要算得省。从上层的能力门控融合先验信息,到底层的次二次注意力机制优化算力,AI正从单纯拼参数走向拼机制和架构优化的新阶段。只有双管齐下,大模型才能真正解决复杂现实问题。