sentinelK
V2EX  ›  Local LLM

mac m5 ultra 上线中国官网。1.2T 显存带宽, 256GB 版本 8.6 万

  •  
  •   sentinelK · 2 days ago · 8411 views
    编者注:此文完全是数字推演,不代表真实硬件能力。笔者不对信息准确度负责。
    信源会罗列在文章下方
    

    结合 256GB 统一内存来看,目前比较有价值的就是运行 ds-v4-flash-0731 ,恰巧最近 omlx 有过一次版本更新,官方性能数据如下:信息来源 f917c000-707f-43a1-b0a1-23bd464ed4e9-image.jpeg

    然后,M5 Ultra 的内存带宽是 M3 Ultra 的接近 1.5 倍。又根据苹果官网数据,其 prefill 性能是 M3 Ultra 的 4 倍( ollama 数据,框架不同,只能参考)

    所以大概预期,M5 Ultra 运行 ds-v4-flash-0731 Q4 的大致性能是:

    prefill

    上下文 M3U ( v0.5.4rc2 )
    1K 531.0 ~1590 ~2120
    4K 486.5 ~1460 ~1950
    64K 468.5 ~1410 ~1870
    128K 438.6 ~1320 ~1750

    decode

    场景 M3 Ultra M5 Ultra 预计
    MTP 关,1K 27.6 ~40
    MTP 关,4K 25.8 ~38
    MTP 关,64K 22.8 ~33
    MTP 关,128K 21.3 ~31

    信息来源: https://newreleases.io/project/github/jundot/omlx/release/v0.5.4rc2

    https://www.apple.com.cn/mac-studio/

    https://omlx.ai/compare

    51 replies    2026-08-28 10:04:56 +08:00
    sentinelK
        1
    sentinelK  
    OP
       2 days ago
    也就是说,结合实际场景,大概实际应用时打开 MTP ,prefill 也就是 1500 左右的水平,decode 大概在 60 左右。

    prefill 性能仍然偏低。

    但是结合非常大的统一内存,能实现非常高的多会话缓存命中能力,所以和多卡部署相比,有利有弊。
    FrankAdler
        2
    FrankAdler  
       2 days ago via Android
    NVIDIA 打下的江山,Apple 开始摘桃子了吗
    ReinXD
        3
    ReinXD  
       2 days ago
    这个价格对比 n 卡服务器,甚至可以说性价比爆表,统一内存的架构优势在 LLM 时代凸显出来了
    xiaoyi123
        4
    xiaoyi123  
       2 days ago
    虽然比不上 nvidia ,但是便宜啊!!!!!
    octocatami
        5
    octocatami  
       2 days ago
    快囤 mac mini
    ila
        6
    ila  
       2 days ago
    可以使用 DeepSeek V4 Flash Vision Exp 吗
    Cruzz
        7
    Cruzz  
       2 days ago   ❤️ 1
    逼的哪天老黄给显卡加内存条。让你们胡搞
    scegg
        8
    scegg  
       2 days ago
    这速度适合一个人玩玩。甚至不适合一个人干活(并发 agent 的情况)。
    Nzelites
        9
    Nzelites  
       2 days ago
    dsf 什么时候个人部署可以比较简单的到 100tps 的话感觉比较可用
    sillydaddy
        10
    sillydaddy  
       2 days ago
    是不是比双 DGX Spark 要强?
    sentinelK
        11
    sentinelK  
    OP
       2 days ago
    @sillydaddy 从推论来讲,是。但是这个需要看实测。
    毕竟 GB10 跑的是 cuda ,mlx 环境不能直接横比。
    clemente
        12
    clemente  
       2 days ago
    @ReinXD 同配置 nv spark 只要 3w 啊
    OnEvent
        13
    OnEvent  
       2 days ago via iPhone
    这玩意是不是还能多机并联增加性能来着
    ReinXD
        14
    ReinXD  
       2 days ago
    @clemente dgx spark 显存没有 512g ,这个区别挺大的,跨越到 512g 意味着可以部署满血 1M 版本的 dpsk v4f ,而且 m5 ultra 带宽 1.2TB/s 也是吊打 dgx ,大模型计算核心耗时其实都是权重搬运,这个对实际使用提升应该是非常巨大的。总的来说,和 dgx 完全不是同级别的硬件,dgx spark 还是有点不上不下,m5 ultra 已经摸到云端服务器水平了,考虑到个人/小团队使用甚至非常超模,部署的好很有可能比用官方 api 的体验还舒服
    flyico
        15
    flyico  
       2 days ago
    Q4 量化版,和满血版能相差多大?
    dragonszy
        16
    dragonszy  
       2 days ago
    是不是得等 512gb 的版本
    mkdirmushroom
        17
    mkdirmushroom  
       2 days ago
    目前准备搞个 256 的,up 建议等 512 吗?个人感觉模型参数量大的话,受制于内存带宽,性能不会好到哪里去,所以感觉 512 的意义不是很大,相较于 256 的话。
    ReinXD
        18
    ReinXD  
       2 days ago   ❤️ 1
    @mkdirmushroom 真要买得等 512g ,能满血部署 1M dpsk v4f 是质变,不然不如买块 5090 玩,1.2T/s 对 1-4 个人来说其实是很超模的带宽水平,你对比 H200 那种 4.5T/s ,这么点人数根本吃不满带宽,楼主的估计其实还保守了点,低负载下+dspark mtp 加速,我算了下理论上至少能到 100 token/s
    unifier
        19
    unifier  
       2 days ago
    @dragonszy 跑 dsv4f 应该用不到 512 的,glm 的量化版本应该至少要 512 了
    sentinelK
        20
    sentinelK  
    OP
       2 days ago
    @dragonszy @mkdirmushroom 如果只是聚焦于 0731 的话,个人谨慎预测,性价比很低。
    v4-flash 无损就是 8bit ,所以其实 256GB 已经可以跑无损(和 GB10 * 2 逻辑一样),但是 prefill 和 decode 会更难看。

    而且家用不太可能同时占用太多个 session 的 kvcache 。同时保持 3~5 个 session 是在线的我已经觉得大脑过载了。

    512GB 的优势一个是能同时保持更多的 1M 上下文的 session 在线(能命中缓存)以外,就是能跑更大规模的模型。
    但是反过来说,更大规模的模型 prefill 和 decode 会更慢。

    所以,统一内存方案的掣肘就在这,看似能跑很大的模型,但是实际把 RAM 占满速度又无法接受。
    aimuz
        21
    aimuz  
       2 days ago
    256G 的要 14 万,512G 应该不会少于 20 万吧?
    tanszhe
        22
    tanszhe  
       2 days ago
    话说最近小米发布的 o100 也是 1.2T 带宽 是不是类似?
    sentinelK
        23
    sentinelK  
    OP
       2 days ago
    @tanszhe 这个完全没有基础数据,所以只能看看了。毕竟内存带宽只是一个必要条件,并不是充分条件。
    LLM 的表现和硬件、生态、框架、甚至模型本身都息息相关。

    就像是保时捷 911 卡雷拉的前悬挂用的依然是麦弗逊结构。但你不能说用多连杆的面包车比他更运动。
    slowgen
        24
    slowgen  
    PRO
       2 days ago
    今晚 Qwen3.8-Flash-Next 发布,和 Ling-3.0-Flash 差不多大小,125B A6B ,如果性能追上 DeepSeek v4 Flash 0731 的话,其实 256GB 就够。

    人的欲望总是随着新模型的发布不断上涨,买 512GB 赌的是未来这个容量可以跑下更大更 SOTA 的开源模型,赌 Fable 5 级别的模型很快就可以跑在个人设备上。
    sosme
        25
    sosme  
       2 days ago
    @tanszhe 小米那个应该和老黄那个 nv spark 差不多,统一内存撑死 128g
    kenvix
        26
    kenvix  
       1 day ago
    @FrankAdler #2 好事,总得有人给牢黄上点强度
    Gomoku2024
        27
    Gomoku2024  
       1 day ago
    其实更强的是可以多台 Studio 组合,实现 TB 级别的超大显存。
    wy315700
        28
    wy315700  
       1 day ago
    所以 4080S 32G 魔改版来了,8 卡刚好 256G 显存。
    巧不巧,惊喜不惊喜,意外不意外。
    iugo
        29
    iugo  
       1 day ago
    将来可能会有架构变动,比如 Cerebras 在 decode 场景性能很强,将来会有优化,但我觉得这个变动很可能不来自 NV 。
    winning11k
        30
    winning11k  
       1 day ago
    @slowgen 跑上了速度也太慢,时间也是钱
    beginor
        31
    beginor  
       1 day ago via Android
    泼一点儿冷水,Mac 并发很差的,多用户根本不能和 NV 比,买台十几万的 Mac 个人用是不是太奢侈了?
    mrzx
        32
    mrzx  
       1 day ago
    @beginor 买 8 块 4080S 32G 魔改版 个人用,是不是更奢侈?
    CyouYamato
        33
    CyouYamato  
       1 day ago
    @sillydaddy 我查了现在的评测加上对于 m3 ultra 的估计,两台 dgx spark 明显更快.虽然 mac 内存带宽大.
    c0xt30a
        34
    c0xt30a  
       1 day ago
    我这么算 tg:
    - 1.2TB/s 的带宽
    - dsv4-flash 的激活是 13B 的 fp4 ,大概是 6-7 GB
    - 1M 上下文时候 bf16 kv 是 7 GB


    所以不带 mtp:
    - 在 ctx=0 时,1200/7 = 171 tok/s
    - 在 ctx=1M 时,1200/(7+7) = 85 tok/s

    参考:
    - https://www.reddit.com/r/LocalLLaMA/comments/1svzlog/the_exact_kv_cache_usage_of_deepseek_v4/
    azuis
        35
    azuis  
       1 day ago via Android
    @Gomoku2024 组合不了,没有高速接口。nvidia spark 起码还有 200G 网卡
    andyJado
        36
    andyJado  
       1 day ago
    MK47
        37
    MK47  
       1 day ago
    有一个问题啦,不管是苹果还是小米的那个盒子 ,都没有 CUDA 生态
    coefu
        38
    coefu  
       1 day ago
    512 的串起来是可行的,pipeline 模式的 layer 切割,其实没有那么多 要传输的数据,mac thunderbolt 5 120Gb/s 的速度,每台设备有 2 个,刚好上下串起来。

    mac 没有 cuda ,只是性能问题,但是首先能不能跑来都保证不了,性能无从谈起。
    zzutmebwd
        39
    zzutmebwd  
       1 day ago
    搜一下 dgx spark 双机并联跑 ds4f 的数据,比这个快不少。
    whooc
        40
    whooc  
       1 day ago
    完全没钱买
    ryanzhou
        41
    ryanzhou  
       1 day ago
    明年在看吧,模型现在发展很快,目前订阅还是靠谱的,本地模型能力追上之后,届时产能也会转向。
    mkdirmushroom
        42
    mkdirmushroom  
       1 day ago
    @sentinelK 买了 256GB 了,显示 10 月 24 后送达,先用用看,不行出掉应该也亏不了太多,有个 5090 ,正好互补下。
    mkdirmushroom
        43
    mkdirmushroom  
       1 day ago
    @ReinXD 买了 256 了,到时候测试下效果吧,不行出掉去
    coefu
        44
    coefu  
       1 day ago
    @mkdirmushroom 要出的时候,记得先艾特我,我喜欢。😍
    wishuloveme
        45
    wishuloveme  
       1 day ago
    以后架构可能围着存储了,中间一个硕大的存储芯片周围 n 个小核心😂
    keenkiller
        46
    keenkiller  
       21h 47m ago via Android   ❤️ 1
    还是太慢了
    yjiefl
        47
    yjiefl  
       21h 22m ago via iPhone
    搞多几台组网
    aru
        48
    aru  
       19h 22m ago   ❤️ 1
    选好了配置,心满意足的关闭了网页
    xuanbg
        49
    xuanbg  
       10h 14m ago
    @Cruzz 显卡上一直都是有内存颗粒的,那玩意一般叫“显存”
    tobepro
        50
    tobepro  
       7h 30m ago
    @xuanbg 他的意思应该是是显存可插拔
    sadan9
        51
    sadan9  
       7h 3m ago
    @azuis 之前 M3 已经有方案,RDMA over Thunderbolt
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   5231 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 174ms · UTC 09:08 · PVG 17:08 · LAX 02:08 · JFK 05:08
    ♥ Do have faith in what you're doing.