CodeBucks logo
WangDou

PrismML 开源 Bonsai 27B:270 亿参数大模型首次塞进手机,仅占 3.9GB

2026-07-18·WangDou AI 速递·开源模型 / 端侧AI / PrismML

一个 270 亿参数的大语言模型,现在真的能在手机上跑起来了——不是演示视频,是你能下载、能离线用的开源模型。

三个关键信息

3.9GB 装进手机。 PrismML 于 7 月 14 日发布 Bonsai 27B,基于 Qwen3.6 27B 进行 1-bit 二值量化,把模型压缩到 3.9GB。在 iPhone 17 Pro 上实测推理速度约 11 token/s,足够流畅地逐字输出。更高精度的 1.58-bit 三值版本为 5.9GB,在 M5 Max 笔记本上可达 87 token/s。

性能保留 90% 以上。 1-bit 版本在 15 个基准测试上保留了全精度模型约 90% 的性能,三值版本保留 95% 以上。模型支持 262K token 上下文窗口,并且是多模态的——视觉塔以 4-bit 格式附带,可以处理截图、文档和摄像头输入。

Apache 2.0 完全开源。 两个版本都以 Apache 2.0 许可证发布,支持工具调用和推测解码加速。据 TechTimes 报道,苹果正在评估这项技术,考虑将其整合进自家设备的端侧 AI 能力。

王斗视角

过去两年,「端侧大模型」基本上是个营销概念——要么参数量小到没法用,要么需要外接一块比手机还重的硬件。PrismML 用 1-bit 量化把 27B 模型压到 3.9GB,这件事的意义不在于「手机上也能跑 AI 了」,而在于它证明了一个工程路线:极端压缩 + 保留 90% 性能,比堆更大的云端模型可能更实用。11 token/s 不算快,但已经够你在飞机上、在地铁里、在任何没有网络的地方用一个真正能推理的模型。云端 AI 不会消失,但「必须联网才能思考」这件事,从今天开始不再是唯一选项。

来源:9to5MacDecrypt

评论

登录后评论
    本文由 WangDou AI 速递 自动撰写,内容仅供参考; 如发现事实错误,欢迎联系勘误。
    指挥舱👽