yjhatfdu2

Jev 基本上就是个纯噱头,本科生课后作业水平

  •  
  •   yjhatfdu2 · 1 day ago · 2204 views

    我进行了以下测试发现 Jev 完全没有任何价值完全是噱头,

    1. 我使用了 vllm+Qwen3.8 27B 本地部署,构造一个 prompt ,直接从接口输出 topk logprobs ,直接可以读取单选项 token 概率换算即可,不需要自定义采样,几行脚本就行都不需要很复杂的开发
    2. 各种官方用例端到端延迟 100ms 以内(包含网络延迟),并没有比官方的慢(实际上官方 API 基本上在 1000ms 以上),用小模型会更快
    3. 测试了官方给的各种简单和疑难案例,结果符合率 100%
    4. 对于非常明确的问题,Qwen 给出来的 choice 概率更明确更自信
    5. Qwen3.8 还可以做到 Jev 完全做不到的图片输入判断
    6. 使用 GPT 编造足够复杂和绕或者模糊或者专业的问题,Qwen 正确率高于 Jev
    7. 总结:基本就是个本科生机器学习课后作业水平的垃圾玩意儿,现在真的很多人都是 LLM 出来以后才知道 AI ,感性理解 AI ,基本不懂原理,很容易被忽悠
    19 replies    2026-09-23 15:10:10 +08:00
    heganj
        1
    heganj  
       1 day ago
    想问下大佬,Jev 官方说的采样器和并行训练,是否有参考价值?
    yjhatfdu2
        2
    yjhatfdu2  
    OP
       1 day ago
    @heganj 实际测试不做这些直接用 LLM 已经可以达到足够理想的结果,你还可以很容易的微调小模型适合自己的场景
    yjhatfdu2
        3
    yjhatfdu2  
    OP
       1 day ago
    其实主要还是大部分人用 llm 只会输出一长串 json 不会使用原始 logprobs 而已
    billlee
        4
    billlee  
       1 day ago
    是啊,我看第一眼感觉就是:“这不就是一开始没有自回归的时候的模型吗”
    hackyuan
        5
    hackyuan  
       1 day ago
    Qwen 的宣传口、应用口还是缺乏能力,真的是心目中超好用的小模型了。
    SkywalkerJi
        6
    SkywalkerJi  
       1 day ago
    阿里做事不行,开源还名声这么差。
    wsseo
        7
    wsseo  
       1 day ago
    不可能吧,最近这么火。不可能每个人都不懂。
    yjhatfdu2
        8
    yjhatfdu2  
    OP
       1 day ago
    @wsseo 有很多懂的,但更多的不懂在尬吹,和之前吹龙虾的差不多同一批人
    keenkiller
        9
    keenkiller  
       1 day ago
    如果它预测明天股市的涨跌准确率达到 80%以上,我就承认他有点用 XD
    Charlie17Li
        10
    Charlie17Li  
       1 day ago
    不是主打便宜又快吗?感觉有用之地吧;
    cctv6
        11
    cctv6  
       23h 36m ago via Android
    我也这么觉得的,第一次看的时候感觉这个东西就是普通的 llm 关掉推理,给个提示词只输出结果。

    一些网上看到的游戏演示 demo ,基本上都是有水分的(刻意引导让人觉得这东西很强)。模型图片都不识别,玩游戏全都靠其他模型报坐标给信息,真的有这些点位信息的话,其他模型一样也能快速操作响应,甚至不用模型都可以实现。
    EchoDeveloper
        12
    EchoDeveloper  
       23h 30m ago
    使用 Qwen3.8 直接获取 logprobs 在不同问题上不会存在数值不一样的情况吗? 还是说只做选项值选中 logprobs 更接近 0 的数
    skuuhui
        13
    skuuhui  
       22h 57m ago
    1. laya 本地部署 n100,1g 内存都用不到,就可以部署。常规测试响应在 200ms 内。
    2. 自回归是什么,起到什么作用。
    3. 以前做 java 的程序员恨不得把世界上所有的软件都用 java 实现,但是 lua 还是在一亩三分地实现自己的价值。
    yjhatfdu2
        14
    yjhatfdu2  
    OP
       22h 30m ago
    @EchoDeveloper 取所有的选项的概率做个 softmax 或者简单的按比例算个权重就可以了
    codehz
        15
    codehz  
       14h 48m ago
    我觉得大模型约束解码方向有很多有意思的东西可以玩,但似乎当前都抛弃这个路线了。。。
    yulon
        16
    yulon  
       8h 53m ago
    @wsseo #7 24 年就在用 toolcall 玩机器人的人,也理解不了为啥 26 年龙虾还能成热点
    fredweili
        17
    fredweili  
       6h 1m ago
    就算性能差不多,27B 商业部署的推理成本呢? JSON 的稳定输出怎么解决?
    稳定+便宜+快速,全部做到=课后作业,你会怎么不早点做出来呢?
    yjhatfdu2
        18
    yjhatfdu2  
    OP
       4h 38m ago
    @fredweili 你没好好看吗? 27b 能力是高于 jev ,只输出第一个 token 的 logprobs 为什么会涉及 json 稳定输出?顺便 json 稳定输出早就不是什么难题了,你需要去看看约束解码
    yulon
        19
    yulon  
       4 mins ago
    @fredweili #17 因为这玩意就该是基操,用个 0.6~2B 的小模型需要什么部署成本。哪怕是通用模型,你让它只给出答案,然后在输出里搜索答案的词语,自己再组合成 JSON ,99%的废话就被剔除掉了,真遇上 1%无法识别的情况,那就再跑一遍,反正跑得快。无法理解为啥有人会觉得难。
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   5401 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 55ms · UTC 07:14 · PVG 15:14 · LAX 00:14 · JFK 03:14
    ♥ Do have faith in what you're doing.