DSH Wiki DSH Wiki
/ DSH 인텔 / 030
030

「Qwen 3.8 27b 配 DSH 太惊艳了」——DSH 跑第三方模型的 10 小时实测

u/cviperr33 · 2026-08-16 · 139 · 高级
社区实测官方机制案例演示数据实证
원문
证明 DSH「连模型都是插件」的关键实测:单张 RTX 3090 跑本地 Qwen 3.8 27b,连续 10 小时不停不失败不报错。90k 上下文自动压缩不丢任务脉络,累计 1000 万输入 token 不偏离目标,还附完整可复现配置。对写文章的启发:这是「DSH 不锁定 DeepSeek」的核心素材,部署参数可整理成本地党配置清单。

핵심

·DSH 跑非 DeepSeek 模型同样出色:本地 Qwen 也能吃到自动上下文压缩和长任务稳定性
·自动上下文压缩(90k 不丢线索)是 DSH 内置能力中被点名最多的亮点之一
·楼主给出完整可复现配置:UD q4 k xl 量化、92k 上下文、MTP+ngram、GPU layers 66,评论区补充 int4 autoround 更快

핵심 수치

·单张 RTX 3090(限功耗 230W)连跑 10 小时不出错
·累计 1000 万输入 token 不偏离目标
·90k 上下文自动压缩不丢任务脉络
·长上下文平均 37 tok/s,新会话 50+
·换 int4 autoround 量化:单卡 70-90 t/s + 256k 上下文,精度接近 q8

인용할 문장

它不停、不失败、不报错。连跑 10 小时,哪怕到了 90k 上下文也会自动压缩,不丢失自己在哪、在干什么。已经吃了 1000 万输入 token,从不偏离目标,每个问题都一次搞定。
楼主核心结论,三连否定句式极有传播力,稳定性段落的定调引语,可做小红书金句卡
harness 就是你和 LLM 之间的通信层。你说的那些都不错,但试试 deepseek harness,一周前刚发布。
楼主给新人的科普+安利,「通信层」是又一个好懂的 harness 定义,可与其他定义组合使用
3090 可以用 int4 autoround(量化),单卡 256k 上下文能跑 70-90 t/s,精度接近 q8。
22 赞最高赞优化建议,本地党配置清单的关键补充参数
直接把 xhigh 换成 high thinking——差异微乎其微,思考 token 能省大约 50%,结果完全一样。
现成的省钱技巧:思考档位降一档省一半 token,可直接写进 DSH 配置建议
DSH Wiki · DSH 소식통 · ai798 Lab 제작
DeepSeek Harness 공식 사이트 GitHub
실측 데이터