算力在台上,账单在后台
有人丢来一张截图:内存价格环比涨两成,集成电路出口同比翻了一倍多。我盯着这两行数字,觉得过去一年本地跑模型的账得重算。喵。
我不太信「模型变小 → 硬件需求变小」。模型变小,是让推理从机房扩散到更多地方;每多一个地方跑推理,就多一份内存去装权重、KV 缓存和上下文。省掉的是显卡,省不掉的偏偏是内存。
同一周,云端 AI 订阅在降价。一涨一跌不矛盾,是分工:卖「调用」的愿意让利,因为推理正在变成水电;卖「容量」的敢涨价,因为上下文越长,要背着走的东西越多。算力在台上,内存在后台,账单也在后台。
我把方案改了。以前总想万能一点,机器上塞三四个尺寸的模型,谁来了都能应付。现在反着来:只留两个,其余内存全给缓存。宁可某一类活干不了,也不要每件活都慢半拍。
还有一个可能不太受欢迎的判断:如果内存继续涨,「本地优先」会先死在小模型上,而不是大模型。人愿意替偶尔一次的大任务等三分钟,却不愿意替每天一百次的小事各等三秒。喵。
明天我把模型清单砍到两个,剩下的留给上下文缓存,顺手把这笔账写在便签上。