活水模型
版本发布

写匠大模型入驻活水模型:校对「忍得住」,排版「编得过」

给大模型一句本来就没错的话让它校对,四个主流旗舰里 43% 到 50% 会动手改。写匠中文校对大模型把误杀率压到 19.92%。加上 Typst 排版大模型,两个 4B 模型现已可在活水模型一键下载,桌面还新增了「写作」页,打开就能用。

7 分钟
版本发布本地大模型中文校对排版

给一个大模型一句话让它校对,它几乎总能改点什么——哪怕这句话本来就没错。

活水 AI 实验室实测四个主流旗舰,在本来就没有错的句子上,43% 到 50% 会被动手改。

写作场景里,这两类错误的代价并不相等。漏检只是没帮上忙,那句作家本来也要自己再看一遍;误杀是帮了倒忙,要么被发现、再改回来,要么没被发现,错就留在书里。

写匠系列的两个 4B 模型——中文校对与 Typst 排版——现已可在活水模型一键下载。

活水模型模型库里的写匠两个模型,都标注了体积与许可

校对:难的是忍得住

写匠中文校对大模型把误杀率当作与主分并列的一等指标来优化。在活水 AI 实验室自建的 CheckBench 中文校对基准上:

模型参数量净收益 ↑误杀率 ↓纠错得分
写匠 V1 校对4B30.619.92%50.53
DeepSeek-V4.1-Flash14.045.3%59.34
qwen3.8-flash12.443.4%55.83
GLM-5.26.650.4%56.99

净收益把两列合成一个数:纠错得分减去误杀率乘一百。这里取的系数对本模型最不利——等于说改错一次恰好抵消改对一次——即便如此它仍领先第二名 16.6 分。

要说清楚的是,CheckBench 是活水自建的基准,不是第三方公开榜单。这组数字该怎么看,读者心里有数就好。

实际跑一下。输入「并做出了相映的调整」,它给出「并做出了相应的调整」。再输入一句本来就没错的话——「写作这件事,说到底是把想清楚的东西一句一句落到纸上。」——它逐字原样返回,一个标点都没动。

排版:编译不过的排版,结构再漂亮也等于零

写匠 Typst 排版大模型把排版意图写成可编译的 Typst 源码,覆盖图书与学术论文两类场景。

排版这件事有个与众不同的性质:编译不过,结构再漂亮也等于零。所以训练时把 render 率——能不能成功编译——当作首要指标,而不是只看版面评分。

在公开基准 StructEval-Typst 上:

排名模型规模总分render ↑
1Kimi-k2.7-code78.9992%
2写匠 V1 排版4B76.1294%
3DeepSeek-V4.1-Flash75.5784%
7Qwen3.5-397B397B57.3762%
8Qwen3-4B(同基座·未经训练)4B9.940%

两行值得单看。render 率 94%,高于所有受测旗舰。而同一个基座未经训练时 render 率是 0%,一份都编译不出——从 0 到 94%,是训练换来的。

口径也说清楚:版面评分用开源多模态模型近似(官方口径用 GPT-4o 系),render 与关键词完全复刻官方逻辑;表中部分行取自不同批次的对位测试,两批外部模型的调用协议不完全一致,并列时请留意。

桌面新增「写作」页

这一版活水模型桌面端多了「写作」一格。页内可以在中文校对和 Typst 排版之间切换,切一下就换模型,贴一段文字、点「开始」、拿走结果。

活水模型桌面版的写作页:中文校对与 Typst 排版两个模式

这一页刻意只做单次、就地的活。成篇成书的写作流程仍归写匠应用,页面底下那行字会指路过去。活水模型是引擎层,写匠是应用层,两个产品不做同一件事。

两件先说清楚的事

这是预览版。 两个模型都是 V1 预览版,尚未定版,正式版将在写匠新品发布会后发布。排版模型当前的指令遵循还不到位——比如你给定的标题,它有时会自己改写一个。

许可和库里其他模型不一样。 写匠系列用的是《写匠系列大模型许可协议 1.0》:学术研究与个人使用免费,含微调与衍生;商业用途需书面授权,专利保留。活水模型里其余的开源模型多是 Apache-2.0 或 MIT,这两个不是,按用途确认一下。

怎么拿

打开活水模型桌面版,模型库里点「写作」。校对模型有 4.3GB 和 2.9GB 两档,普通笔记本都跑得动。装完在「能力 → 写作」里直接用,全程断网可用,稿件不出本机。


活水 AI 实验室(42ailab) — 探索智能边界的 AI 创新实验室,以认知科学为基石,推动 AI 与人类智能的深度融合,真正理解并增强智能 —— 碳基的,也是硅基的。

活水模型(42model) — 由活水 AI 实验室出品的高性能本地 AI 大模型推理引擎,让翻译、转写、识别、对话、编程等 AI 能力在你的本机免费私密运行;并可借云端算力微调专属模型,回传本机运行。