它不停、不失败、不报错。连跑 10 小时,哪怕到了 90k 上下文也会自动压缩,不丢失自己在哪、在干什么。已经吃了 1000 万输入 token,从不偏离目标,每个问题都一次搞定。
楼主核心结论,三连否定句式极有传播力,稳定性段落的定调引语,可做小红书金句卡
harness 就是你和 LLM 之间的通信层。你说的那些都不错,但试试 deepseek harness,一周前刚发布。
楼主给新人的科普+安利,「通信层」是又一个好懂的 harness 定义,可与其他定义组合使用
3090 可以用 int4 autoround(量化),单卡 256k 上下文能跑 70-90 t/s,精度接近 q8。
22 赞最高赞优化建议,本地党配置清单的关键补充参数
直接把 xhigh 换成 high thinking——差异微乎其微,思考 token 能省大约 50%,结果完全一样。
现成的省钱技巧:思考档位降一档省一半 token,可直接写进 DSH 配置建议