小模型,不是小目标
参数越少,冗余越无处藏身。我们相信模型的能力上限由数据密度与方法决定, 而不是由显卡数量决定。
参数量 ↓ · 密度 ↑「朝闻道,夕死可矣。」——《论语·里仁》
我们只做小模型。把参数量让给数据密度,把算力让给方法—— 让模型小到能装进口袋,深到能读懂一句唐诗。
大模型在比谁的参数更多,我们在比谁的单位参数更值钱。 小模型不是妥协的结果,而是我们对「理解」这件事的押注方式。
参数越少,冗余越无处藏身。我们相信模型的能力上限由数据密度与方法决定, 而不是由显卡数量决定。
参数量 ↓ · 密度 ↑圆角、渐变、阴影、光泽,全都是可以用来说服人的修辞。 我们把修辞删掉,只留下网格、直线和三种颜色。
勃艮第红 · 墨 · 纸古体诗的格律、平仄、用典、意象与言外之意,几乎无法靠概率糊弄过去。 能写诗的小模型,别的任务都不会太差。
何意味 HiWhy 的由来一条线解决「说清楚」,一条线解决「说不出来」。
聊天与问答机器人系列。以「敏而好学,不耻下问」为名, 目标是做一个反应快、答得准、跑得动的对话模型。
全球首个纯古体诗模型。基底训练已经完成, 它只做一件事:把你想说的那点意思,写成一句合格的古体诗。
朝闻道 DaoPath 是牵引力实验室(Pull Together Lab)旗下的 AI 研究品牌。 「朝闻道,夕死可矣」讲的是求知的紧迫感:如果一件事值得弄明白,那就今天弄明白。
我们把这句话用在小模型上。参数越大越强是一条成立但懒惰的路径; 我们更想弄清的是,一个足够小的模型,究竟能把「理解」做到多深。