开源模型正在重写 AI 的经济学逻辑
深思圈 · 商业与创投
深思圈 2026-09-05 09:38 浙江 当 token 变得足够便宜,AI 的竞争逻辑会彻底变。Ollama CEO Jeffrey Morgan 最新访谈:开源模型一年暴增 150 倍背后,真正稀缺的已经不是算力,而是知道怎么用的判断力。 你有没有想过,企业用AI这件事的底层逻辑,正在被彻底重写?过去几年,大家默认的路径是:接OpenAI或Anthropic的API,按token付费,跟着大厂的节奏走,能用就行。但现在,越来越多的企业正在悄悄做一件事——把工作负载从闭源模型切换到开源模型(open models),不是因为闭源模型不够好,而是因为他们意识到,长期依赖一个自己完全不能控制的黑盒,本质上是把企业AI能力的命脉交了出去。 最近我看了一期Y Combinator的Lightcone Podcast,嘉宾是Ollama联合创始人兼CEO Jeffrey Morgan。Ollama是目前全球最主流的开源模型运行平台,有900万开发者在用,GitHub上有17.8万颗星,财富500强里有85%的公司都在使用它。Jeffrey坐在开源模型分发链路最核心的位置上,他看到的token流量数据,比任何市场报告都更真实。这期访谈让我重新想了一遍整个开源模型的格局,也让我对AI基础设施未来的演变路径有了一些新的判断,想在这里完整分享出来。 成本是入场券 控制权才是真正的目标 Jeffrey说了一句话我觉得非常准确:成本是企业转向开源模型的最直接驱动力,但真正的北极星(north star)是控制权,是能把模型定制成真正懂自己业务的工具。成本只是一个短期问题,解决之后,企业才能腾出手去做真正重要的事。 我观察到很多企业用AI的路径有一个共同规律。第一阶段,先把API接上,能跑就行,不太在乎成本;第二阶段,token消耗涨上来之后,成本压力出现,开始考虑怎么降;第三阶段,成本控下来了,但发现模型对自己业务场景的理解还是不够精准,于是开始认真考虑fine-tuning(微调)或者部署开源模型。走到第三阶段的企业,才算真正进入了AI能力建设的深水区。 这个从"能用"到"好用"再到"可控"的路径,在我看来是不可跳过的。很多企业想直接跳到第三阶段,但技术积累和业务理解都是需要时间沉淀的。开源模型不是省钱的捷径,而是一种需要企业自身能力配套的战略选择。Jeffrey提到的那些真正走通这条路的企业,背后都有一支对AI基础设施有深刻理解的技术团队。这本身就是一种门槛,而不是人人都能轻松绕过的捷径。 Token用量爆炸的背后:Coding Agent打开了新世界 Jeffrey在访谈里展示了一张Ollama云端的token用量曲线。从今年年初到访谈录制时,整体token用量增长了150倍。但更有意思的是另一张图——每个开发者每周的token用量,也就是人均消耗,同样出现了指数级增长。这说明不是用户变多了,而是每个人用的量都在快速增加。 这背后有两个关键节点。第一个是今年年初,Qwen(通义千问)、GLM(智谱)、Minimax等开源模型开始真正有能力驱动coding agent(编程智能体)。Coding agent的token消耗量本来就远高于普通对话,因为它需要反复调用工具、检索代码、写测试、执行命令,完成一个任务可能要消耗数十万token。第二个节点是今年四月,OpenClaw这个开源coding agent框架崛起,随后Hermes agent项目也跟着起来。Jeffrey说Hermes的出现让长时间自动化任务的能力从开发者群体扩展到了非技术人员——无论是财务、市场还是销售,都能用上这套能力。Context window(上下文窗口)从128K扩展到百万token级别,也是这一波爆发的重要基础,因为长上下文直接决定了agent能处理多复杂、多长链的任务。 我对这个趋势有一个很强烈的感受。Coding agent不只是程序员的工具,它本质上是一种把复杂任务分解、执行、验证的通用能力框架。当这个框架真正开放给非技术人员的时候,才算是AI生产力革命真正落地的起点。而这一切的前提,是开源模型的能力足够支撑起这套框架的运转。Qwen、GLM这些模型的能力跃升,不只是一个技术里程碑,更是一个产业节点。 Fine-tuning:不是在跟潮流走 是在跟模型发布周期赛跑 主持人问了一个很有意思的问题:2024年初fine-tuning很热,然后热度消退,大家觉得自己花时间训的模型会被下一个大版本直接踩平。现在fine-tuning又回来了,这到底是另一个周期,还是真的站稳了? Jeffrey的回答很直接。他说开源模型的迭代节奏只会越来越快。就拿今年夏天来说,DeepSeek Flash模型已经迭代了三次,而以前类似的迭代周期可能要六个月。节奏加快确实让自定