AMAZINGINDEX.COM 日报快照
60.5
VOL. 2026.08
2026.08.22
← 返回 2026.08.22 日报
日报快照 · Daily Snapshot
NO. 011

Qwen 3.8 27B 30分钟逆向工程实战

#ARTICLE HackerNews 2026.08.22
推荐指数 81.0 NO. 011 · 2026.08.22
发布2026/08/23Score103Comments49

Qwen 3.8 27B 在单台 GB10 工作站(128GB 统一内存)上通过 SGLang + NVFP4 + 投机解码优化后达 50 tokens/s,完成了一项 30 分钟的逆向工程任务。本地大模型的代码与推理能力已达到可替代云端 API 的生产级水平,对数据敏感型和成本敏感型团队是重大利好。

GB10 的 128GB 统一内存是关键变量——它让 27B 模型能完整驻留而不需要量化到面目全非,这是笔记本级设备以前做不到的。NVFP4 配合投机解码的「标准配方」正在形成,意味着本地部署的优化路径开始收敛,不再是各凭手艺的黑箱。

真正值得跟踪的是成本结构:这台工作站约 3000 美元级别,跑 30 分钟任务的电费 vs 同等质量云端 API 调用,交叉点已经到来。做安全研究、固件分析、闭源代码审计的团队,现在可以认真评估「本地模型 + 人工复核」替代「云端 API + 数据脱敏」的流程重构了。

但要注意,作者提到的「15-30 tokens/s 出厂速度」才是多数人的实际体验,50 tokens/s 需要特定软件栈调优——这意味着本地部署的门槛从「硬件」转移到了「工程能力」。

意见分歧 53 条评论

核心争论:本地模型能否替代云端API,以及模型审查与无审查的权衡

jchw

I'd personally like to know more about what tools it used/wanted and the harness setup, because this sounds pretty cool. I have a dual Arc Pro B70 setup and currently get around 22 t/s which isn't great but isn't terrible either (it is at least less quantized.) I've seen GPT 5.6 Sol happil

trollbridge

My M5 Pro gets around 12-15 (6 bit MTP), although I haven’t worked on optimising it at all yet. A nice thing about running locally is you can run an uncensored model and you don’t have to worry about TOS violations on your OpenAI account when you ask it to “reverse engineer this ancient router firmw

medler

Qwen is very much censored. Just try asking it about Tiananmen or how to build a bomb. But it is nice that you can experiment with it locally without having to worry about your account getting nuked

替代方案: GPT 5.6 SolOpenAI APIGhidraobjdumpPiMythos
查看原文 →