yjhatfdu2's recent timeline updates
yjhatfdu2

yjhatfdu2

V2EX member #457268, joined on 2019-12-04 10:30:20 +08:00
Today's activity rank 5677
yjhatfdu2's recent replies
4 days ago
Replied to a topic by gtanyin OpenAI 可稳定的 ChatGPT 的梯子求助~
买的最便宜的梯子,挂了两个 pro 号,半年了一直稳定
6 days ago
Replied to a topic by Need4more Local LLM mac 本地部署 llm 不是最佳选择
当然我遇到一个有趣的点,我本地部署一些模型测试(因为客户有私有化需要),和云 API 对比,会发现云 API 有不会通知你的降智现象,表现为有些 agent 场景本地基本上稳定能完成,云端需要看时段,高峰时段可能就完不成
M5 才有 tensor core 支持 AI 算力,M4 没有哦
@sentinelK 我现在用的是最新的 vllm ,改了一下 jinja ,基本上没有遇到这些问题,但是有个偶现的 GPU 报 Xid 31 导致奔溃的问题,可是 flashinfer 的 B12x 内核在长上下文、高并发、MTP 下的 bug ,就先凑合着用吧,codex 跑几个小时可能会遇到一次
@wcwcxiaobin 你可以试试呢,muse 大部分的局部注意力,长上下文也有可能不集中
@catazshadow 开 128K 和能力有什么关系? Qwen3.8 估计关掉 thinking 都可以把 muse 吊起来打,所有的客观测试分数都相差两代的水平了,AA 比开了 reasoning 的 Qwen3.6 27B 都低三分,也就比 Qwen3.6 35B 好一点,真的是拉大了。
@sentinelK 这个应该是因为 qwen3.8 只有几个有限的思考等级,和 codex 的那几个不匹配,需要改 jinja 模版做映射
@yjhatfdu2 我是 PRO 6000 ,感觉现在 sm120 架构还是支持有限
@catazshadow 规模更大,所有评测都落后一大截,AA 更是 35 比 52 ,这怎么叫打的有来有回呢?应该是全方位无死角吊打。Qwen 你也可以开 128k 上下文
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   3352 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 20ms · UTC 11:11 · PVG 19:11 · LAX 04:11 · JFK 07:11
♥ Do have faith in what you're doing.