BaseRT 正式发布:专为 Apple Silicon 打造,Mac 本地大模型推理速度飙升 6.4 倍

2026年7月,大模型本地化部署领域迎来了一位重磅选手——BaseRT 正式面向公众发布。这不是又一个大模型本身,而是一个专为 Apple Silicon 芯片从头构建的 AI 推理引擎。它在 M5 Pro 芯片上实现了最高 6.4 倍 于 llama.cpp、3.9 倍 于 MLX 的提示词处理速度,被业界称为“Apple Silicon 上最快的 LLM 运行时”。

BaseRT 由总部位于澳大利亚墨尔本的 Base Compute 团队开发。在大模型应用从“能用”走向“好用”的当下,BaseRT 的出现,为解决“如何在本地设备上高效、私密地运行大模型”这一关键问题提供了一条全新的路径。

BaseRT 与 llama.cpp、MLX 性能对比

▲图片由AI生成      BaseRT 在 M5 Pro 上的性能表现,Prefill 速度最高达 llama.cpp 的 6.4 倍

一组关键数字:BaseRT 在 M5 Pro 上预填充(Prefill)速度最高达 6.4 倍于 llama.cpp、3.9 倍于 MLX;解码(Decode)速度最高达 1.75 倍于 llama.cpp;支持 LLaMA、Qwen3、Gemma、Whisper、BERT 等主流模型家族;覆盖 0.6B 到 35B 参数规模。

一、BaseRT 是什么?

BaseRT 是一款自包含的 本地 AI 推理引擎,专为 Apple Silicon 芯片(M 系列)设计,可直接在 Mac 上运行大型语言模型,完全绕过云端依赖。

与 llama.cpp、MLX 等现有方案不同,BaseRT 是一个 从零构建 的 C++ 运行时,直接针对 Apple 的 Metal GPU API 编写,不依赖 MLX、PyTorch、CoreML 等任何中间框架。它用 单一二进制文件 替代了按 token 计费的 API 成本和数据隐私顾虑:该文件可拉取模型、提供 OpenAI 兼容端点,并暴露 Python、Node、Rust 和 Swift 的绑定。

发布时间线

  • 2026年6月30日:BaseRT 学术论文发布
  • 2026年7月1日:BaseRT 正式公开发布
  • 2026年7月19日起:国内外科技媒体广泛报道

关键规格一览

指标数据
产品定位Apple Silicon 本地 LLM 推理引擎
技术架构原生 Metal 实现,零中间框架依赖
支持模型LLaMA、Qwen3、Gemma、Whisper、BERT 等
量化格式Q2 到 FP16,共 8 种
参数规模0.6B 到 35B
编程语言绑定Python、Node、Rust、Swift
开源地址github.com/basecompute/baseRT

二、BaseRT 诞生的行业背景

BaseRT 的发布,正值大模型部署从“云端优先”走向“端云协同”的关键转折点。

随着大模型能力的持续提升,开发者对 隐私保护、成本控制、低延迟 的需求日益强烈。将数据发送到云端 API 处理,不仅面临按 token 计费的高昂成本,在代码审查、医疗数据等敏感场景中更存在合规风险。然而,在 Mac 上本地运行大模型的体验并不理想——现有运行时(如 llama.cpp 和 MLX)要么需要大量配置开销,要么缺乏生产级编码代理所需的吞吐量。

BaseRT 联合创始人在 Product Hunt 上表示:“我们认为 端侧推理即将变得非常重要,而 Apple Silicon 是运行它的最佳消费级硬件。只是软件一直没有跟上芯片的发展,我们正试图弥合这一差距。”

三、核心技术解析:BaseRT 为何能跑得更快?

1. 原生 Metal 实现,零抽象开销

现有运行时通常带有跨平台兼容性的历史包袱——CPU 优先的代码库、惰性求值的数组框架或通用调度层,这些抽象在 Metal 的执行模型下留下了大量性能损耗。BaseRT 则直接针对 Apple 的 Metal GPU API 编写,没有不必要的抽象、惰性图评估或通用调度循环。这意味着每一行代码都在为 Apple Silicon 的硬件特性服务。

2. 手写 Metal 计算着色器与内核融合

BaseRT 配备了一个庞大的 手写 Metal 着色器库,涵盖矩阵乘法、注意力、归一化、RoPE、嵌入、激活和采样等所有关键操作。矩阵乘法内核针对解码(M=1)和预填充(M>1)分别做了专门优化,每种量化格式(从 2-bit 到 16-bit)都有独立的内核变体。更重要的是,BaseRT 融合了其他运行时通常分开发送的算子序列——在注意力路径和前馈网络内部都进行了融合,每次融合都减少了一次内核启动和一次全局内存往返。

3. 零内存分配的解码循环

模型加载后,BaseRT 的解码循环 不分配任何新内存。残差、注意力、前馈的临时缓冲区、logits 和 token 缓冲区,甚至 KV 缓存,都在加载时一次性分配好,每个 token 都重复使用。热路径上只剩下 GPU 命令分发和轻量级的 CPU 端修补。

4. 架构描述符与 M5 Tensor Core 优化

BaseRT 将不同模型架构之间的差异——激活函数、归一化变体、MoE 路由、注意力机制、位置编码约定——表达为一个 紧凑的架构描述符。核心引擎消费这个描述符,从不根据模型身份进行分支判断,热路径对所有模型完全一致。在 M5 Pro 上,BaseRT 充分利用了 M5 新增的 Tensor Core 架构,通过 Metal 4 Tensor API 提供的底层计算能力获得了明显的性能提升。

四、实测表现:速度与吞吐量的全面领先

1. 基准测试:全面超越 llama.cpp 和 MLX

BaseRT 在 Qwen3、Llama 3.2 和 Gemma 4 等多个模型家族上进行了全面测试,覆盖 0.6B 到 35B 参数规模。在 Apple M5 Pro(48GB 内存)上的测试结果如下:

测试场景对比 llama.cpp对比 MLX
预填充(Prefill)最高 6.4 倍最高 3.9 倍
解码(Decode)最高 1.75 倍最高 1.33 倍

数据来源:BaseRT 官方基准测试

在具体模型上,Qwen3 0.6B Q4 的解码速度达到 464.5 tok/s——比 llama.cpp 快 56%,比 MLX 快 35%。Gemma 4 E2B Q8(pp2048)的预填充达到 16,264 tok/s。在 MoE(混合专家)模型上,BaseRT 的优势更为显著,预填充速度最高可达 llama.cpp 的 1.81 倍

2. 学术验证:Apple Silicon 上最高的推理吞吐量

BaseRT 的学术论文报告称,这是迄今为止在 Apple Silicon 硬件上 最高的推理吞吐量。研究结果表明,Apple Silicon 作为推理平台的能力 远超此前报告的水平。论文作者指出,随着隐私要求、延迟约束和云成本压力推动推理向端侧部署迁移,性能优化的本地运行时是这一转型的关键使能层

五、使用场景与生态定位

注重隐私的企业工具。 开发者在构建内部代码审查助手时,需要通过 LLM 处理专有代码片段。将数据发送到云端 API 违反合规要求。使用 BaseRT,一条命令即可启动本地端点,每个 token 都留在 MacBook Pro 上——零数据离开设备

离线开发环境。 在飞机上工作的承包商、在气隙设施中的研究员,或任何 API 连接不可靠地区的用户,都需要无需互联网的 LLM 辅助。BaseRT 支持 完全离线工作,工作流程与云端推理一致。

编码代理后端。 BaseRT 提供了与本地编码代理的集成能力。运行一条命令即可获得一个 具备工具调用能力的本地编码代理——无需 API 密钥,数据不离开机器。

OpenAI 兼容服务器。 一条命令即可暴露聊天补全、嵌入、转录、重排序、工具调用、持续批处理、分页 KV 缓存和前缀缓存。针对 OpenAI API 编写的现有代理代码 零改动 即可路由到 BaseRT。

六、常见问题解答

BaseRT 是开源的吗?
是的。BaseRT 已公开在 GitHub 上:github.com/basecompute/baseRT。安装只需一条命令:curl -LsSf https://basecompute.co/install.sh | sh

BaseRT 支持哪些模型?
目前支持 LLaMA、Qwen3、Gemma、Whisper、BERT 等模型家族。添加新模型是一个 自包含的声明式改动,无需修改核心推理循环。

需要什么硬件?
BaseRT 支持 所有 Apple M 系列设备(M1、M2、M3、M4、M5),要求 macOS 14(Sonoma)或更高版本。在 M5 Pro 上表现最为出色,充分利用了 M5 新增的 Tensor Core 架构。

如何快速开始?
三条命令即可开始:
– 安装:curl -LsSf https://basecompute.co/install.sh | sh
– 下载模型:basert pull Qwen/Qwen3-4B
– 对话:basert chat Qwen/Qwen3-4B

BaseRT 和 llama.cpp、MLX 有什么区别?
主要区别在于:
架构:BaseRT 从零构建,直接针对 Metal API,零中间框架依赖
性能:在预填充阶段优势最为明显,最高达 llama.cpp 的 6.4 倍
部署:单一二进制文件,无需 Python 运行时、无需 conda 环境

七、总结与展望

BaseRT 的发布,为 Apple Silicon 生态的本地大模型部署树立了一个 新的性能标杆。它以原生 Metal 实现、手写着色器、零内存分配解码等技术创新,证明了 端侧推理的性能天花板远未被触及

BaseRT 联合创始人在 Product Hunt 上表示,他们正试图弥合“芯片能力”与“软件利用”之间的差距。随着 M5 系列芯片的普及和端侧 AI 需求的爆发,BaseRT 所代表的“让每一颗芯片的算力都被充分释放”的理念,将成为大模型部署领域的重要方向。

对于开发者、企业和 AI 应用创业者而言,BaseRT 提供了一个 隐私、成本、性能三者兼得 的全新选择——无需将数据上传云端,无需支付按 token 计费的成本,即可在自己的 Mac 上获得生产级的 LLM 推理体验。

一句话总结:BaseRT 是专为 Apple Silicon 打造的本地 LLM 推理引擎,以原生 Metal 实现实现最高 6.4 倍于 llama.cpp 的预填充速度,支持 LLaMA、Qwen3、Gemma 等主流模型,零数据离开设备。适合 AI 开发者、注重隐私的企业、离线环境工作者、编码代理构建者 重点关注。

了解更多:访问 BaseRT GitHub 仓库BaseRT 官网 开始体验

© 版权声明

相关文章

暂无评论

none
暂无评论...