sentinelK
V2EX  ›  Local LLM

mac m5 ultra 上线中国官网。1.2T 显存带宽, 256GB 版本 8.6 万

  •  
  •   sentinelK · 17h 54m ago · 4624 views
    编者注:此文完全是数字推演,不代表真实硬件能力。笔者不对信息准确度负责。
    信源会罗列在文章下方
    

    结合 256GB 统一内存来看,目前比较有价值的就是运行 ds-v4-flash-0731 ,恰巧最近 omlx 有过一次版本更新,官方性能数据如下:信息来源 f917c000-707f-43a1-b0a1-23bd464ed4e9-image.jpeg

    然后,M5 Ultra 的内存带宽是 M3 Ultra 的接近 1.5 倍。又根据苹果官网数据,其 prefill 性能是 M3 Ultra 的 4 倍( ollama 数据,框架不同,只能参考)

    所以大概预期,M5 Ultra 运行 ds-v4-flash-0731 Q4 的大致性能是:

    prefill

    上下文 M3U ( v0.5.4rc2 )
    1K 531.0 ~1590 ~2120
    4K 486.5 ~1460 ~1950
    64K 468.5 ~1410 ~1870
    128K 438.6 ~1320 ~1750

    decode

    场景 M3 Ultra M5 Ultra 预计
    MTP 关,1K 27.6 ~40
    MTP 关,4K 25.8 ~38
    MTP 关,64K 22.8 ~33
    MTP 关,128K 21.3 ~31

    信息来源: https://newreleases.io/project/github/jundot/omlx/release/v0.5.4rc2

    https://www.apple.com.cn/mac-studio/

    https://omlx.ai/compare

    33 replies    2026-08-27 01:28:59 +08:00
    sentinelK
        1
    sentinelK  
    OP
       17h 51m ago
    也就是说,结合实际场景,大概实际应用时打开 MTP ,prefill 也就是 1500 左右的水平,decode 大概在 60 左右。

    prefill 性能仍然偏低。

    但是结合非常大的统一内存,能实现非常高的多会话缓存命中能力,所以和多卡部署相比,有利有弊。
    FrankAdler
        2
    FrankAdler  
       17h 29m ago via Android
    NVIDIA 打下的江山,Apple 开始摘桃子了吗
    ReinXD
        3
    ReinXD  
       17h 24m ago
    这个价格对比 n 卡服务器,甚至可以说性价比爆表,统一内存的架构优势在 LLM 时代凸显出来了
    xiaoyi123
        4
    xiaoyi123  
       17h 11m ago
    虽然比不上 nvidia ,但是便宜啊!!!!!
    octocatami
        5
    octocatami  
       17h 10m ago
    快囤 mac mini
    ila
        6
    ila  
       16h 42m ago
    可以使用 DeepSeek V4 Flash Vision Exp 吗
    Cruzz
        7
    Cruzz  
       16h 40m ago
    逼的哪天老黄给显卡加内存条。让你们胡搞
    scegg
        8
    scegg  
       16h 40m ago
    这速度适合一个人玩玩。甚至不适合一个人干活(并发 agent 的情况)。
    Nzelites
        9
    Nzelites  
       16h 16m ago
    dsf 什么时候个人部署可以比较简单的到 100tps 的话感觉比较可用
    sillydaddy
        10
    sillydaddy  
       16h 14m ago
    是不是比双 DGX Spark 要强?
    sentinelK
        11
    sentinelK  
    OP
       16h 10m ago
    @sillydaddy 从推论来讲,是。但是这个需要看实测。
    毕竟 GB10 跑的是 cuda ,mlx 环境不能直接横比。
    clemente
        12
    clemente  
       14h 37m ago
    @ReinXD 同配置 nv spark 只要 3w 啊
    OnEvent
        13
    OnEvent  
       13h 13m ago via iPhone
    这玩意是不是还能多机并联增加性能来着
    ReinXD
        14
    ReinXD  
       12h 12m ago
    @clemente dgx spark 显存没有 512g ,这个区别挺大的,跨越到 512g 意味着可以部署满血 1M 版本的 dpsk v4f ,而且 m5 ultra 带宽 1.2TB/s 也是吊打 dgx ,大模型计算核心耗时其实都是权重搬运,这个对实际使用提升应该是非常巨大的。总的来说,和 dgx 完全不是同级别的硬件,dgx spark 还是有点不上不下,m5 ultra 已经摸到云端服务器水平了,考虑到个人/小团队使用甚至非常超模,部署的好很有可能比用官方 api 的体验还舒服
    flyico
        15
    flyico  
       12h 3m ago
    Q4 量化版,和满血版能相差多大?
    dragonszy
        16
    dragonszy  
       11h 51m ago
    是不是得等 512gb 的版本
    mkdirmushroom
        17
    mkdirmushroom  
       11h 41m ago
    目前准备搞个 256 的,up 建议等 512 吗?个人感觉模型参数量大的话,受制于内存带宽,性能不会好到哪里去,所以感觉 512 的意义不是很大,相较于 256 的话。
    ReinXD
        18
    ReinXD  
       11h 29m ago   ❤️ 1
    @mkdirmushroom 真要买得等 512g ,能满血部署 1M dpsk v4f 是质变,不然不如买块 5090 玩,1.2T/s 对 1-4 个人来说其实是很超模的带宽水平,你对比 H200 那种 4.5T/s ,这么点人数根本吃不满带宽,楼主的估计其实还保守了点,低负载下+dspark mtp 加速,我算了下理论上至少能到 100 token/s
    unifier
        19
    unifier  
       11h 26m ago
    @dragonszy 跑 dsv4f 应该用不到 512 的,glm 的量化版本应该至少要 512 了
    sentinelK
        20
    sentinelK  
    OP
       11h 26m ago
    @dragonszy @mkdirmushroom 如果只是聚焦于 0731 的话,个人谨慎预测,性价比很低。
    v4-flash 无损就是 8bit ,所以其实 256GB 已经可以跑无损(和 GB10 * 2 逻辑一样),但是 prefill 和 decode 会更难看。

    而且家用不太可能同时占用太多个 session 的 kvcache 。同时保持 3~5 个 session 是在线的我已经觉得大脑过载了。

    512GB 的优势一个是能同时保持更多的 1M 上下文的 session 在线(能命中缓存)以外,就是能跑更大规模的模型。
    但是反过来说,更大规模的模型 prefill 和 decode 会更慢。

    所以,统一内存方案的掣肘就在这,看似能跑很大的模型,但是实际把 RAM 占满速度又无法接受。
    aimuz
        21
    aimuz  
       11h 23m ago
    256G 的要 14 万,512G 应该不会少于 20 万吧?
    tanszhe
        22
    tanszhe  
       11h 14m ago
    话说最近小米发布的 o100 也是 1.2T 带宽 是不是类似?
    sentinelK
        23
    sentinelK  
    OP
       11h 11m ago
    @tanszhe 这个完全没有基础数据,所以只能看看了。毕竟内存带宽只是一个必要条件,并不是充分条件。
    LLM 的表现和硬件、生态、框架、甚至模型本身都息息相关。

    就像是保时捷 911 卡雷拉的前悬挂用的依然是麦弗逊结构。但你不能说用多连杆的面包车比他更运动。
    slowgen
        24
    slowgen  
    PRO
       11h 1m ago
    今晚 Qwen3.8-Flash-Next 发布,和 Ling-3.0-Flash 差不多大小,125B A6B ,如果性能追上 DeepSeek v4 Flash 0731 的话,其实 256GB 就够。

    人的欲望总是随着新模型的发布不断上涨,买 512GB 赌的是未来这个容量可以跑下更大更 SOTA 的开源模型,赌 Fable 5 级别的模型很快就可以跑在个人设备上。
    sosme
        25
    sosme  
       10h 39m ago
    @tanszhe 小米那个应该和老黄那个 nv spark 差不多,统一内存撑死 128g
    kenvix
        26
    kenvix  
       6h 46m ago
    @FrankAdler #2 好事,总得有人给牢黄上点强度
    Gomoku2024
        27
    Gomoku2024  
       6h 22m ago
    其实更强的是可以多台 Studio 组合,实现 TB 级别的超大显存。
    wy315700
        28
    wy315700  
       6h 19m ago
    所以 4080S 32G 魔改版来了,8 卡刚好 256G 显存。
    巧不巧,惊喜不惊喜,意外不意外。
    iugo
        29
    iugo  
       5h 43m ago
    将来可能会有架构变动,比如 Cerebras 在 decode 场景性能很强,将来会有优化,但我觉得这个变动很可能不来自 NV 。
    winning11k
        30
    winning11k  
       4h 6m ago
    @slowgen 跑上了速度也太慢,时间也是钱
    beginor
        31
    beginor  
       4h 4m ago via Android
    泼一点儿冷水,Mac 并发很差的,多用户根本不能和 NV 比,买台十几万的 Mac 个人用是不是太奢侈了?
    mrzx
        32
    mrzx  
       2h 40m ago
    @beginor 买 8 块 4080S 32G 魔改版 个人用,是不是更奢侈?
    CyouYamato
        33
    CyouYamato  
       2h 12m ago
    @sillydaddy 我查了现在的评测加上对于 m3 ultra 的估计,两台 dgx spark 明显更快.虽然 mac 内存带宽大.
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   971 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 74ms · UTC 19:41 · PVG 03:41 · LAX 12:41 · JFK 15:41
    ♥ Do have faith in what you're doing.