Pseudorandom Thoughts
Reply一个月过去了,眼看网安类bench上不断发生一些涌现,我更加怀疑乙方给甲方企业推销的VDH和PTS产品的意义。
Workflow:你做的workflow和工具适配是很好,但很快AI就要带着agentic RSI杀过来了(哪怕DSH因为过度的FP洁癖区了,这个概念也已经被验证成立,下一批模型会把定制agent runtime和pi的能力训进去);
漏洞知识:你攒的漏洞知识库是很棒,但思维下一个版本就会OPD训进模型里面再给你涌现点奇迹;
也就是乙方交付慢慢从定制workflow,到定制agent(知识+技能),接下来可能不得不去定制高速小模型(带着自己的场景OPD,譬如找大模型摇一点CoT再拿点为了验证这一点,我化身大模型民科(全靠大肥鱼代打),让大肥鱼扒了CryptoPals、CryptoHack和其他一些crypto CTF题(好验证,纯代码,词表小,舒适区),持续从0731和V4.1暴力蒸CoT,然后在一台GB10上,对着Ling-3.0-Tiny(一个8B-A1B的小模型)暴力叠logits做SFT。目前在验证集上的最终结果还没跑完,但已经提示SFT过的小模型获得了显著的长思维链和工具调用倾向。后面本频将会写个文简单讲讲过程。
4 · 342 ·