活水模型
版本发布

活水模型 bench 功能上线:你的电脑跑大模型有多快,点一下就知道

本地跑大模型,第一个问题永远是「我这台电脑跑得动吗、跑多快」。活水模型上线测速:每个模型的「⋯」菜单里点一下,几十秒出一份能直接发给别人看的报告。对话、翻译、语音、图文、嵌入五类能力各报各自该报的数,结果可复制可导出。

10 分钟
版本发布本地大模型性能测速模型选型

本地跑大模型,绕不开的第一个问题只有一个:我这台电脑,跑这个模型到底多快?

以前答不上来。模型详情页写着参数量和体积,那是模型的属性,不是它在你这台机器上的表现——同一个模型,换一台机器,快慢是另一回事。想要准数,只能自己开一段对话,掐着表数字数。

现在点一下就有了。

活水模型的测速结果卡片:MiniCPM5-1B 对话生成,加载 0.6 秒、首字延迟 24 毫秒、生成速度每秒 239.2 个 token、峰值内存 0.8 GB

在「我的模型」或模型库里,每个模型行末尾的「⋯」菜单中选「测速」。小模型几秒钟,几十 GB 的大模型要一分多钟——它得先把模型整个载进内存,而这个耗时本来就是要报的数之一。测完出这么一张卡片,四个数:加载多久、等第一个字多久、出字多快、占了多少内存。

每类能力,报它自己该报的数

活水模型上跑的不只是对话模型。翻译、语音识别、图文识别、嵌入各有各的活儿,用同一套指标去套是说不通的——语音转写报「每秒多少 token」没有意义,你想知道的是「一小时的录音要转多久」。

所以测速按能力分档,各报各的:

语音识别的测速结果:Qwen3-ASR-0.6B,速度 48.9 倍实时,每分钟音频 1.2 秒转完

  • 对话 / 编程:等第一个字(TTFT)、生成速度、读入速度
  • 翻译:同样三项,跑的是真实的中英段落
  • 语音识别:相对实时的倍数,以及「一分钟录音要转多久」
  • 图文识别:每页多少秒
  • 嵌入:每条多少毫秒

上面那张图里,Qwen3-ASR 的 0.6B 档是 48.9 倍实时——一分钟的录音,1.2 秒转完。一小时的会议录音,一分十几秒。这个数比「每秒多少 token」有用得多。

慢,到底是慢在读还是慢在写

「速度」这个词,其实糊着两件事。

模型回答你之前,得先把你的问题连同之前的对话整个读进去——像开口之前先把整摞资料翻一遍,这一段叫读入(prefill);翻完才提笔,一个字一个字往外写,这一段叫生成(decode)。两段的快慢差着一个数量级,还随输入的长短此消彼长。

只报一个「平均每秒多少 token」会骗人。你问一个长问题、它答一句短话,平均下来的数字低得吓人,看着像模型坏了——其实它下笔一点不慢,只是前面翻得久。

所以两个都报。慢在读还是慢在写,你一眼看得出来。

报告是给人读的

测完可以「复制结果」或「导出结果」,拿到的是这样一份东西:

--------------------------------------------------
42model 测速报告
deepseek-v4-flash:iq2 · 对话生成 · 2026-08-07 18:32
--------------------------------------------------

这台 Apple M3 Max 上,deepseek-v4-flash:iq2 每秒生成 24.9 个 token,
等第一个字 873 毫秒;模型首次载入用了 51.5 秒。

【测速结果】
  等第一个字(TTFT)    873 毫秒
  生成速度(decode)    每秒 24.9 token
  读入速度(prefill)   每秒 79 token(中等输入)
  首次加载              51.5 秒
  内存占用              0.1 GB(峰值)

【怎么测的】
  测试负载              标准档(v2)· 跑 3 次取中间值
  运行方式              GPU 加速

【在什么机器上】
  芯片                  Apple M3 Max
  内存                  128.0 GB
  线程                  16
  系统                  macOS

【读这组数之前】
  · 测速时后台还有模型常驻,占着内存和显卡——这组数可能比这台机器的真实水平偏低。
  · 「内存占用」是测速全程每 0.1 秒采一次、取最高的那次。它通常偏小……
  · token 是模型处理文本的最小单位,中文大致 1 个字 ≈ 1~2 个 token。

--------------------------------------------------
由 42model 0.4.9 测得 · 记录 1786098735684-deepseek-v4-flash-iq2
活水模型 · https://42model.com
--------------------------------------------------

它是照着「要发出去给人看」写的:开头一句话说完结论,指标名中文在前、英文缩写留在括号里(方便你拿这个数去跟别处的评测比),末尾记着哪个版本测的、记录编号是多少——发到群里,别人问得清。

测出来的数好不好看是一回事,你能不能知道它是怎么来的,是另一回事

同一台机器,28 个模型的成绩单

我们把本机已下载的 28 个模型逐个测了一遍,同一台 M3 Max 128GB。挑几个:

模型类别结果
MiniCPM5-1B对话每秒 239.2 个 token,首字 24 毫秒
Qwen3.5-9B对话每秒 48.2 个 token,首字 223 毫秒
DeepSeek-V4-Flash对话 · 2840 亿参数每秒 24.9 个 token,首字 873 毫秒
hy-mt2 7B翻译每秒 60.1 个 token,首字 137 毫秒
Qwen3-ASR-0.6B语音48.9 倍实时
PP-OCRv6-Small图文每页 1.4 秒
Qwen3-Embedding-0.6B嵌入每条 37 毫秒

前沿档的测速结果:DeepSeek-V4-Flash-IQ2,加载 51.5 秒、首字延迟 873 毫秒、生成速度每秒 24.9 个 token

同一台机器,表里那个 1B 的小模型和 2840 亿参数的前沿档,出字速度差了将近十倍。这个差距值不值,取决于你要它干什么——而这正是测速想让你自己看见的东西。

这些数也不是一测就永远是这个数。同一个模型在同一台机器上前后测两次,差个两三成是常事——后台开着什么、机器热不热,都算数。所以报告里才要写清「测的时候是什么状况」——数字要连着它的来路一起读。

这组数怎么读才不跑偏

测的时候如果后台还常驻着别的模型,它占着内存和显卡,量出来的数就会偏低。这件事测速自己会说——报告里写着,命令行跑的时候也会提前提醒你一句。想要一组干净的数,先「停止引擎」(命令行是 42model serve stop)再测。

「内存占用」那一行也要留个心眼:它通常偏小。模型文件是按需映射进内存的,显卡那边占的也不一定算得进来。这一行回答的是「测的时候大概占了多少」,不是「跑这个模型需要多少内存」——后者看模型卡上标的「最低 N GB」。

点开你的第一个模型

活水模型 v0.4.9 已经发布,下载后自动更新即可。打开模型库或「我的模型」,找到任意一个已下载的模型,点「⋯」,选「测速」。

命令行也有:42model bench <模型>,加 --json 拿结构化结果。

买机器之前先看别人的数,装完模型之后测自己的数。

你的机器到底什么水平,从今天起有个准数


活水 AI 实验室(42ailab) — 探索智能边界的 AI 创新实验室,以认知科学为基石,推动 AI 与人类智能的深度融合,真正理解并增强智能 —— 碳基的,也是硅基的。

活水模型(42model) — 由活水 AI 实验室出品的高性能本地 AI 大模型推理引擎,让翻译、转写、识别、对话、编程等 AI 能力在你的本机免费私密运行;并可借云端算力微调专属模型,回传本机运行。