catazshadow's recent timeline updates
catazshadow

catazshadow

V2EX member #399613, joined on 2019-04-08 17:11:05 +08:00
Today's activity rank 4281
catazshadow's recent replies
阿里巴巴那种管理方式,注定做什么都是烂尾
2 days ago
Replied to a topic by zzutmebwd › Local LLM › pro6000 部署 Qwen 3.8 flash next nvfp4
@coefu 上下文压小了确实会快点,回头看看怎么搞
2 days ago
Replied to a topic by zzutmebwd › Local LLM › pro6000 部署 Qwen 3.8 flash next nvfp4
@coefu 还能这么玩。要配合 flash next 还是都可以?压缩了会变傻么?
2 days ago
Replied to a topic by zzutmebwd › Local LLM › pro6000 部署 Qwen 3.8 flash next nvfp4
@coefu qwen 3.8 flash next ,就你上一条发的那个

电费算毛 hhh 。还有就是 layer split 其实每一时刻只有一张卡满载,总功率其实是(N - 1) 待机功率 + 1 x 满载功率,6 张卡也就 400W 来瓦顶天了,几千块搞定 Strix Halo 能干的活,要什么自行车🤣
2 days ago
Replied to a topic by zzutmebwd › Local LLM › pro6000 部署 Qwen 3.8 flash next nvfp4
@coefu 加上万兆网卡的结果,一共 96G 显存,两台机器 4+2 张卡

qwen 系列的 prefill 感觉跟这种跑法有仇,开头就只有 160 多,直接放弃了。单机用 lazy 模式跑也不快,简直了。

laguna S 和 mistral small 都差不多,加载了个 110K 的会话历史,开始 prefill 在 480 左右,在 110K 的时候大概有 280 ,tg 的话能有 10 左右,感觉是垃圾佬的极限了,毕竟几千块跑起来这么大的模型。
写内核的依旧古法
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   1506 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 22ms · UTC 16:21 · PVG 00:21 · LAX 09:21 · JFK 12:21
♥ Do have faith in what you're doing.