小模型不是过渡方案
它常常被说成「等算力够了就会被取代」的中间形态。我们不这么看。 参数越少,冗余越无处藏身,能力上限由数据密度与方法决定, 而不是由显卡数量决定。小是终点之一,不是候车室。
参数量 ↓ · 密度 ↑这句话出自《论语·里仁》。历来的读法很多,我们取的是最不玄的一种: 如果一件事值得弄明白,那就今天弄明白。 不是「早上知道就值了」,而是「别把它拖到明天」。
求知这件事真正的成本从来不是智力,是时间,是迟疑, 是「等我们把基础设施搭好再开始想问题」。 这句话被我们贴在墙上,主要是因为它是反拖延的。
英文名 DaoPath 把这个意思摊开了:DAO 是道, PATH 是路径。道是那个被追问的东西, 路径是走过去的方式。我们不假设自己已经站在终点,只承诺路径是公开的。
名字起得很大,做的事很小。这是故意的:用一句很大的话, 约束一件很小的事——只做小模型,做到别人不愿意做的那种密度。
「子曰:朝闻道,夕死可矣。」
朝闻道 DaoPath 是牵引力实验室(Pull Together Lab)旗下的 AI 研究品牌。 实验室是母体,负责长期投入、算力与工程的底座; 朝闻道是一条专注的支线,只回答一个问题: 一个足够小的模型,能把「理解」做到多深。
分工很简单,也很少变:品牌负责方向、评测标准与产品形态, 实验室负责让这些方向能跑起来、能复现、能被外部检验。 没有中间层,没有需要对齐的多个目标。
我们把成果按两条产品线公开:已经发布的「问知 Wenzhi」对话与问答系列, 以及基底训练已经完成、即将发布的「何意味 HiWhy」纯古体诗模型。
下面四条不是为了显得有想法,而是因为它们确实会改变我们每天做什么、不做什么。
它常常被说成「等算力够了就会被取代」的中间形态。我们不这么看。 参数越少,冗余越无处藏身,能力上限由数据密度与方法决定, 而不是由显卡数量决定。小是终点之一,不是候车室。
参数量 ↓ · 密度 ↑圆角、渐变、柔光、光泽,都是可以用来说服人的修辞。 模型上也是一样:漂亮的演示、挑选过的样例、含糊的指标, 都算修辞。我们把它们删掉,只留下能被检验的部分。
不只是视觉纪律挑一个没人愿意碰的任务,比刷一个所有人都在刷的榜单更能说明问题。 古体诗是我们选的难关:格律、平仄、用典、意象、言外之意, 几乎无法靠概率糊弄过去。能写诗的小模型,别的任务都不会太差。
何意味 HiWhy 的由来一条做得住的产品线,好过十条做不完的路线图。 我们不追热点名词,不做为了填满发布日历的功能。 发布的东西必须是能用的,不是能上头条的。
克制 · 可复现我们只按顺序说话,不按时间表承诺。阶段之间是门槛,不是日程。
不是懒得做,是决定不做。圆角、渐变、柔光阴影是三种最省力的说服方式: 它们让界面显得柔软、友好、无害,从而让人不去追究内容。 我们做的是研究,最不该省的就是被追究这件事。
所以整站只留下三样东西:网格、直线、三种颜色。 红 #7B1F2E,墨 #101010, 纸 #F3F0E9。2px 实线是唯一的装饰; 页面上没有一个圆角,也没有任何用来填空的抽象图形。
减法还顺便规定了一件事:它没法假装。页面上剩下的每一样东西 都得有理由待在那里——这也是我们要求模型的方式, 说清楚它是什么,而不是看起来像什么。