对本地部署小模型的想法还是太乐观了
AI
之前对本地部署小模型的想法还是太乐观了。肉眼看流式输出,觉得 30 token/s 已经是能用的速度,想着将来有机会本地部署来帮我处理一些未脱敏的文件,能大大降低工作量。
结果细算了一下才发现:就算买台 DGX Spark,跑 Qwen3.8-27B 到 40 token/s,每天 24h×60min×60s 跑满,也只有 3.45M token。每天 300 万 token 实在想不到能在生产环境支撑起什么具体的 Agent 任务。
退一步讲,就算将来 27B 的稠密模型能打破物理定律、真能摸到 Kimi K3 的水平,这个速率也真的什么都干不了。如果想靠 MoE 解决速率问题,总参数一大,一台机器的显存就塞不下了,得上双路或者 Pro6000 这种专业卡,成本翻好几倍。装得下但跑不动 vs 跑得动但装不下,不过账虽然这么算,人还是可以乐观一点,静待天才和时间。