catazshadow's recent timeline updates
catazshadow

catazshadow

V2EX member #399613, joined on 2019-04-08 17:11:05 +08:00
Today's activity rank 3035
catazshadow's recent replies
20 mins ago
Replied to a topic by Donahue › 随想 › 实体倒闭真是活该的
维持商誉的好处是对做长久生意更有利,但是现在这些做生意的主打一锤子买卖打一枪换一个地方,骗人根本没有代价。

真正的代价是让骗子付出一辈子的名誉,这就需要曝光,曝光就要信息自由流动,信息透明度和信息真实性。而这些每一样都是老爷们压制的,为啥?万一老爷自己被曝光了还是次次实锤,那怎么可以。

最后的结果就是能肆无忌惮骗人的互相勾结骗剩下的所有人,哪些人能肆无忌惮骗人?大官和大商人,官商勾结,裙带关系就这么来了

你们抱怨的,全都是自己选的
阿里巴巴那种管理方式,注定做什么都是烂尾
2 days ago
Replied to a topic by zzutmebwd › Local LLM › pro6000 部署 Qwen 3.8 flash next nvfp4
@coefu 上下文压小了确实会快点,回头看看怎么搞
2 days ago
Replied to a topic by zzutmebwd › Local LLM › pro6000 部署 Qwen 3.8 flash next nvfp4
@coefu 还能这么玩。要配合 flash next 还是都可以?压缩了会变傻么?
3 days ago
Replied to a topic by zzutmebwd › Local LLM › pro6000 部署 Qwen 3.8 flash next nvfp4
@coefu qwen 3.8 flash next ,就你上一条发的那个

电费算毛 hhh 。还有就是 layer split 其实每一时刻只有一张卡满载,总功率其实是(N - 1) 待机功率 + 1 x 满载功率,6 张卡也就 400W 来瓦顶天了,几千块搞定 Strix Halo 能干的活,要什么自行车🤣
3 days ago
Replied to a topic by zzutmebwd › Local LLM › pro6000 部署 Qwen 3.8 flash next nvfp4
@coefu 加上万兆网卡的结果,一共 96G 显存,两台机器 4+2 张卡

qwen 系列的 prefill 感觉跟这种跑法有仇,开头就只有 160 多,直接放弃了。单机用 lazy 模式跑也不快,简直了。

laguna S 和 mistral small 都差不多,加载了个 110K 的会话历史,开始 prefill 在 480 左右,在 110K 的时候大概有 280 ,tg 的话能有 10 左右,感觉是垃圾佬的极限了,毕竟几千块跑起来这么大的模型。
写内核的依旧古法
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   2659 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 23ms · UTC 08:54 · PVG 16:54 · LAX 01:54 · JFK 04:54
♥ Do have faith in what you're doing.