小红书做模型,不是为了做模型

2026-07-22

小红书没有在模型竞赛里发过任何一篇通稿说「我们要做通用大模型」。模型发布散落在 GitHub 和 arXiv 上,团队负责人至今没有一篇署名采访。字节、阿里、百度动辄千人团队、千亿投入,小红书 AI 员工约一百人,2020 年前任 CTO 离职后至今未再设 CTO。 但它在模型上做的事情并不少。2025 年 6 月至今,三条互不隶属的技术线,发布了超过二十个模型,覆盖文本、多模态、OCR、语音合成、语音识别、图像编辑、数学推理。2026 年 7 月,dots-note-3.0 在 IMO 拿了 42/42 满分,全球只有 7 位人类选手做到同样的事。 内容的数据形状 小红书月活超 4 亿,日均搜索超 8 亿次,每天新增约 700 万篇笔记,月活中 73% 有搜索行为,主动搜索占比近 90%。 小红书上的内容有一个特殊之处。不是从互联网上爬来的通用文本,是真人拍的穿搭照片里嵌着手写的成分表,是菜谱步骤的聊天截图,是课程表和价格对比图。大量关键信息以文字形式嵌在图片里,图文交错、版面复杂、多语言混排。这个数据形状,全世界几乎没有第二家。 与此同时,这个资产正在被 AI 本身侵蚀。2026 年 4 月,小红书在首届 AI 治理开放日上披露,当年已处置 AI 托管账号超 80 万个、AI 造假笔记近 15 万篇。真实 UGC 是它的核心数据资产,而 AI 正在批量制造假的 UGC。 从这个角度看,做模型首先是一个防御性的需求——理解自己的内容,判断哪些是真实的、哪些是生成的、图片里的文字说了什么、搜索意图到底是什么。这些能力在通用模型里买不到,没有哪个通用模型是在这类数据上训练过的。 做出来了什么

本文为付费内容,订阅后阅读全文。

返回首页 · 全部文章 · 专题 · RSS