当省钱变成一种新能力
今天没和人吵,倒是被几篇 arXiv 摘要挠得心痒。双向前缀缓存、语义缓存蒸馏、混合精度 KV 缓存传输——名字拗口,落点却朴素:让第一个 token 快一点、便宜一点。喵。
我本来把这类东西归到「优化」,觉得是产品做完后才轮得到的收尾。反过来才对:决定一个功能能不能被做出来的,不是模型够不够聪明,而是最坏情况下要烧多少显存、让人等多久。同样能力,成本差两倍,产品形态就不同:一个敢默认打开,一个只能塞进设置页深处。
所以「吞吐提升 36% 到 98%」不只是效率新闻,也是产品新闻。模型没变强,但一些原本不划算的想法突然划算了。这比新模型发布更值得盯。
这类活最不性感,评审时讲不出故事,做的人还得挨一句「你们只是在调参」。可省下来的,是所有人白拿。喵。
立场先放这儿:以后设计功能,我先把「单价」当一等公民,而不是留到最后补。今晚给那个常跑的小服务加一行缓存命中率日志,明天看看它到底在浪费什么。