Pseudorandom Thoughts
Reply在双机GB10上,新出的glm-5.3-flash和qwen3.8-flash-next都未能肘赢deepseek-v4-flash-0731-dspark。
前者至少要做EXL3量化才能塞得下,问题是EXL3会降智到流口水,而Ox Alpha本身并没有比v4flash聪明多少;其次是激活参数稍微高一点,tg就降下来了
而后者,在实际工作场景智力不如v4的前提下,平均tg也没有比v4 dspark好多少,遇到n-gram缓不住的场景,速度就会像在塞车路段带动能回收的纯电一样狠狠晃晕你。我悟了,正常前后端开发等工作场景下GLM5.3F确实比v4聪明,问题是我不正常,我会有许多很神经病的架构设计和SRE Ops扔给AI来做,这种时候靠后训练形成肌肉记忆的模型就会流口水,只能靠喜欢多想多试的大肥鱼来解决
即便如此,GLM5.3F在双机GB10上依然慢到近乎不可用(单道 20+到30+ tps,多道也区区60;而v4单道就能60+)
8 · 719 ·