活水模型
版本发布

活水模型(42model),助你在本地跑生产力级别的大模型

发布会后十天,听取社群 300 多位同学的反馈,活水模型密集升级:日志统计、自动更新、内存护栏落地,推理提速明显,一口气上新 30 多款模型——翻译、OCR、语音转录、对话编程各有代表作。

10 分钟
版本发布本地大模型模型上新GPU 加速

一场发布会结束,产品才真正开始。6 月 27 日新品发布会之后,活水模型(42model)进入密集迭代期:十天里,社群 300 多位同学提交了大量反馈。有人的老显卡跑不起来;有人想看清楚,模型到底吃了多少内存;有人被一个大模型拖得整机卡死。怎么办?逐条改。用户的每一条反馈,都是产品的下一步。十天的变化,归拢为四件事:更完善的基础设施、更快的推理速度、更多 SOTA 模型、更广的硬件架构支持。

更完善的基础设施

本地跑大模型,光「能跑」就够了吗?不够。你还得看得清它在做什么,管得住它吃多少资源。这一轮补齐了三块地基。

日志统计:让引擎的运行看得见

新增一组日志统计命令,把引擎的运行状况变成可以直接看的数字:

42model log stats memory   # 各模型占了多少内存
42model log stats speed    # 各模型的推理速度
42model log stats index    # 各知识库建索引的耗时
42model log stats gpu      # GPU 使用情况,排查算力瓶颈

配合 42model log export 导出与 42model log open 打开日志,遇到问题时不用再猜,桌面版对应的按钮也是同一套能力。其中 log stats gpu 对想搞清楚「算力到底卡在哪」的同学很有用。

自动更新:新版本自己来敲门

桌面版内置自动更新:新版本发布后会自动提示,点一下即完成升级。这段时间几乎每天都有新版本,建议保持自动更新开启,新模型、新能力第一时间就能用上。更新流程本身也做了加固——更新前先预检目录可写性,失败时给出可操作的提示,而不是一句模糊的报错。

内存护栏:模型可以跑不动,电脑不能被拖垮

大模型吃内存,装不下时硬加载会把整台电脑拖死。活水模型现在会在下载和加载前,按你的实际硬件预估内存占用:明确放不下的直接拦住并说明原因;处于边缘地带的给出提醒,但把决定权留给你,不做一刀切。护栏的目标只有一个:模型可以跑不动,电脑不能被拖垮。

更快速的推理速度

这一轮在推理速度上做了两类更新。

一是更多 GPU 架构支持。不管你用的是 NVIDIA、AMD、Intel 的显卡,还是 Apple 芯片,引擎都会自动检测并选用对应的加速方案(CUDA、Metal、Vulkan),老显卡也有兜底路径;需要装驱动时会主动提醒;没有独立显卡,CPU 照样能跑。各类主流 GPU 环境均经过充分实测,提速较为明显。

二是更智能的加载。引擎会根据硬件情况决定怎么加载模型,对 MoE(混合专家)类大模型做了较多优化;加载文本模型时也不再一次性预留过大的对话内存,改为按需分配——同样的机器,能留出更多余量给模型本身。

更多 SOTA 模型收录

发布会至今,活水模型累计上新 30 多款模型,均按 SOTA 标准(各领域公认的第一梯队水平)精选。30 多款,从哪一款用起?这里每个领域挑一款代表作,先简单介绍;后面会有专门的文章逐一展开。

翻译:TranslateGemma

谷歌 2026 年新出品的翻译模型,支持 55 种语言互译,翻译效果出色。活水模型收录的是自行量化后的版本,占用硬盘更小、推理速度更快。从此你手里多了一个免费、离线、不限量的高质量翻译引擎,合同、论文、私密文档都不用再传到云端。目前上线的是 27B 参数档(translategemma:27b-q4_k_m),适合高配电脑。如果需要更小参数,可使用腾讯混元出品的翻译模型 HY-MT2-1.8B 与 HY-MT2-7B。在活水模型桌面版打开「翻译」能力页即可选用,或在模型库搜索 translategemma。

OCR:Unlimited-OCR

百度出品的 Unlimited-OCR(与知名的 DeepSeek-OCR 同出一系,30 亿参数级、运行开销小),近期社区热度很高。活水模型提供量化版(unlimited-ocr:3b-q4_k_m),并在集成中发现并绕过了它在 Mac 上的一个性能崩溃问题——这正是「精选 + 调通再上架」的价值。有了它,扫描件、截图、PDF 里的文字都能在本地识别成可编辑文本,材料不出电脑。在「OCR」能力页选用,或在模型库搜索 unlimited-ocr。

语音转录:Qwen3-ASR-Plus

活水 AI 实验室自己动手增强的转录模型:在阿里 Qwen3-ASR 基础上,加上字句级时间戳与说话人分离,打包成一套开箱即用的组合(qwen3-asr-plus:1.7b,另有配置要求更低的 0.6b 档)。访谈、会议、咨询录音,从此可以一站式转成带时间戳、分说话人的稿件,全程本机完成;律师、咨询师这类对隐私要求高的职业尤其受用。在「转录」能力页选用;今后凡带 plus 后缀的模型,都是实验室的增强版。

对话与编程:DeepSeek-V4-Flash

深度求索的前沿旗舰实验版,2840 亿总参数的 MoE 模型,能力接近云端大模型。活水模型将以 deepseek-v4-flash:iq2 的量化档把它带到本地,作为面向 Pro / Pro+ 用户的前沿档陆续开放,下载前会做订阅、内存与外置盘的完整自检。它把本地对话与编程的能力上限,直接抬到前沿水平。在模型库的前沿档可以找到它,近期会有专文详细介绍。

更多硬件架构支持

活水模型现已同时支持 Windows、macOS、Linux 三大桌面操作系统,覆盖绝大多数桌面用户;配合上面的多 GPU 架构支持,从入门轻薄本到高配工作站都有对应的跑法。

到本周,六种能力(翻译、转录、OCR、对话、检索、编程)对应的 18 款 SOTA 档模型已在单一引擎内全部跑通,另有 20 多款各有所长的国际模型可选。在此之前,想同时跑这几类模型,至少要装两个推理引擎、再自己写不少程序。把这件事收进一个引擎、一个端口的产品,全球范围内还很少见。

以上就是发布会后的第一轮升级。欢迎下载桌面版体验,也欢迎继续在社群里提需求;你今天提的那一条,也许就是下一篇发布日志的主角。生产力级别的大模型,正在住进普通人的电脑。而这,才刚刚开始。


活水 AI 实验室(42ailab) — 探索智能边界的 AI 创新实验室,以认知科学为基石,推动 AI 与人类智能的深度融合,真正理解并增强智能 —— 碳基的,也是硅基的。

活水模型(42model) — 由活水 AI 实验室出品的高性能本地 AI 大模型推理引擎,让翻译、转写、识别、对话、编程等 AI 能力在你的本机免费私密运行;并可借云端算力微调专属模型,回传本机运行。