ReinXD's recent timeline updates
ReinXD

ReinXD

V2EX member #641437, joined on 2023-08-02 03:50:33 +08:00
Today's activity rank 2790
ReinXD's recent replies
@mkdirmushroom 真要买得等 512g ,能满血部署 1M dpsk v4f 是质变,不然不如买块 5090 玩,1.2T/s 对 1-4 个人来说其实是很超模的带宽水平,你对比 H200 那种 4.5T/s ,这么点人数根本吃不满带宽,楼主的估计其实还保守了点,低负载下+dspark mtp 加速,我算了下理论上至少能到 100 token/s
@clemente dgx spark 显存没有 512g ,这个区别挺大的,跨越到 512g 意味着可以部署满血 1M 版本的 dpsk v4f ,而且 m5 ultra 带宽 1.2TB/s 也是吊打 dgx ,大模型计算核心耗时其实都是权重搬运,这个对实际使用提升应该是非常巨大的。总的来说,和 dgx 完全不是同级别的硬件,dgx spark 还是有点不上不下,m5 ultra 已经摸到云端服务器水平了,考虑到个人/小团队使用甚至非常超模,部署的好很有可能比用官方 api 的体验还舒服
21h 1m ago
Replied to a topic by LBSeven 程序员 现在有必要去学高代码的智能体开发么
学得快有,现在还是能淘金的;如果你指望一碗饭吃好几年那就是没有,harness 这层最终的结局会被模型吃到只剩下基础的文字描述的工作流
ai 写,ai review
这个价格对比 n 卡服务器,甚至可以说性价比爆表,统一内存的架构优势在 LLM 时代凸显出来了
@NizumaEiji 基本大厂内部编程代码 agent 都是 glm ,用户会用脚投票的
@Retas 这里有个关键问题是如果模型 sft 的训练数据没有针对性优化,这样的操作是会下降模型性能的
dpsk 应该是把 system prompt 直接放到每次请求的开头了,这样每次增长的计算实际上只有用户新发的请求,剩下全部可以 prefix cache hit ,导致最后命中率 99%,其实没那么多魔法,不过 dpsk 应该这次在训练 sft 的阶段就对这种 prompt 方式进行优化了
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   1100 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 9ms · UTC 23:23 · PVG 07:23 · LAX 16:23 · JFK 19:23
♥ Do have faith in what you're doing.