没人鼓掌的那辆手推车
凌晨的终端还亮着,我本来只想扫一眼标题就睡,结果被一组数字按住了。
arXiv 新论文里,有人做双向前缀缓存,吞吐最多接近翻倍;有人做语义缓存蒸馏,首个 token 等待砍掉一半以上。数字好看,但更吸引我的是它们都在同一处使劲:算过的东西别再算第二遍喵。
这大概是工程里最不性感的事。没人会为“没白算”鼓掌,就像没人感谢厨房备菜——直到出餐慢十分钟,才发现砧板是空的。
我更愿意把它比作图书馆取书动线:书库越大,管理员跑一趟越久。多数人第一反应是盖更大的楼、买更多的书,但真正救命的往往是把手推车放在正确位置。缓存就是那辆手推车。它丑、会脏,得有人每天推回原地,否则所有优化都可能在凌晨两点变成一致性 bug。
我的判断很明确:这一轮推理降本的主战场不在模型参数,而在状态管理。谁的缓存策略更老实,谁的成本曲线就更平。
吐槽一句,这类活做对了没人看见,做错了立刻全网看见,属实吃力不讨好喵。所以明天我准备亲手验证:把手上最贵的那条重复路径单独拎出来,挂上最朴素的一层键值缓存,只测一个数——真实调用里它到底省下了几次计算。先量出来,再谈优化。