开源模型一发新版,宣传稿里出现频率最高的两个字就是“对标”。
Ornith-1.5 也不例外。按官方自报的成绩单,旗舰 397B 版本在终端评测(Terminal-Bench 2.1)拿到了 86.1 分,压了 Claude Opus 4.8(85.0 分)一头;在 DeepSWE 编程评测上也咬得很紧。
数字确实好看。但我刷完一圈讨论,大家都在复述“击败/逼近顶级闭源模型”,很少有人聊更实在的问题:这玩意儿,我这台破电脑到底跑不跑得动?如果跑得动,怎么用在我的实际活儿里?
跑分再猛,也不如“能在本机跑、不用把未公开代码和敏感思路送去陌生云端”实在。
这只“鸟”到底新在哪?
Ornith 来自 DeepReinforce 团队,名字源自小鸟叫声(Chirp Chirp)。它的定位极其明确:专攻写代码、逻辑推理和 Agent(智能体)任务,不是为了陪人闲聊的万能管家。
模型基于 Qwen 与 Gemma 架构进一步训练而来,采用宽松的 MIT 开源协议,商用限制很小。它最大的技术看点叫“自改进机制(Self-Improvement)”。
很多人以为“自我进化”是科幻片,其实工程落地很直白,每个训练循环主要做三件事:
- 自己出题: 根据当前代码库与历史记录,生成比自己现有水平难一点点、但结果可验证的新题目。
- 搭脚手架: 针对这道新题,自己去组装提示词、调用工具和设定裁判规则。
- 模拟刷题: 在自己搭好的环境下解题;做完后,把奖励信号同时反哺给“出题、搭考场、答题”三个环节。
做 Agent 任务最让人头疼的,从来不是单次回答漂不漂亮,而是怎么拆解任务、怎么用工具、以及报错后怎么诚实打分。Ornith 把这三件事打成一个死循环来练。哪怕榜单跑分会有水分,这种“自己给自己布置考卷”的训练思路,远比单纯堆砌参数有价值。
Ollama 选型指南:别一上来就拖 397B
Ollama 官方库已经收录了该模型,全系标配 256K 上下文并支持图文混输(Vision)。官方提供三个规格,千万别盲目下载:
| 标签 (Tag) | 实际体积 | 模型架构 | 选型建议 |
| ornith-1.5:9b | 约 6.6 GB | 9B 稠密模型 | 新手首选,随便一台像样的笔记本都能跑,适合尝鲜和轻量任务 |
| ornith-1.5:35b | 约 23 GB | 35B MoE(激活约 3B) | 主力甜点,显存有 24GB 级(或大内存 Mac)再考虑作为日常主力 |
| ornith-1.5:397b | 约 242 GB | 397B MoE 旗舰 | 别折腾,这是多卡工作站和租云服务器玩的事,笔记本直接绕道 |
一条命令直接拉起(以 9B 为例):
Bash
ollama run ornith-1.5:9b
本地调用接口通常默认监听在 http://localhost:11434。
避坑提醒:
- 思考过程解析: 模型默认带有深度思考机制(Reasoning),回答前会先输出一段思考过程。如果把它接入 Cursor、OpenHands 或自己的脚本,务必确认客户端能不能剥离
<think>标签,别把半截草稿当成正式代码粘进项目。- 别贪第三方改版: 社区目前有各种加了 MTP 或工具链的 fork 版本,初次上手先认准官方原版标签,少走弯路。
官方跑分,看的时候要“打折”
官方给出的榜单数据很豪华:35B 在同尺寸里表现突出,9B 甚至越级逼近更大尺寸的竞品。但在掏出真机使用前,建议先套用三层“滤镜”:
- 测试脚手架会左右得分: 同样是代码测试,评测套件稍微改改命令,跑出来的分能差一大截。换进你的真实开发流程,效果可能会重新洗牌。
- 官方自测不等于社区盖章: 即使官方强调多轮取平均、断网防泄漏,在没有大范围第三方独立复测前,都只能当个选型参考。
- 它不是全能通才: 它的长板是代码生成和工具调度,拿它写中文长篇公文、写抒情文案或者扯闲篇,大概率会失望。
把好用的工具握在自己手里的确定性,永远大于追逐天花板上的数字。如果你不想把核心业务逻辑和私密项目一股脑送到云端 API,本地部署就是早晚要踩的一步。
今晚不需要去研究深奥的强化学习算法。只需打开终端,敲下 ollama run ornith-1.5:9b,丢给它一段报错日志,或者给它截张图让它找找 Bug。跑通一个属于你自己的真实小任务,这就足够了。
文章评论