大模型本地跑,门槛又降了一截。Strata项目用混合专家缓存,在单张RTX 4090上跑通了125B参数模型的推理。Hacker News另一篇高分实践文补了一刀:按量计费的API服务必须默认设硬预算上限。没人盯着的时候,账单能自己长成天文数字。
学界在问一个反直觉的问题:世界模型该忘掉什么?arXiv新论文《What Should World Models Forget?》提出分层保留的持续适应方法,直接挑战老惯例——把旧数据上的性能下降当成失败。这套惯例来自预测目标固定的场景,标签永远是对的。可目标一变,硬记反而拖后腿。有选择地遗忘,比强行全记住更实用。
想彻底搞懂这些模型怎么运作,可以翻《Hands-On Large Language Models》。作者Jay Alammar和Maarten Gr画了近300张自制图,覆盖生成、表示、检索三大方向。Transformer那些绕人的架构,看图比啃公式快得多,工程师上手尤其友好。
把三条消息拼起来,是同一件事的三个切面:推理成本往下压,学习方式往"会忘"上走,理解门槛靠可视化拉低。大模型正从堆参数转向抠细节——能跑、能省、还能讲明白,才算真正落地。