多模态落地的关键要素
2024-12-09
多模态落地的关键要素
多模态的落地有几个关键要素,第一个是模型的基础能力;第二个是场景的需求,不管是用户的日常场景还是垂直的使用场景;第三个是使用场景的延伸。可以从这几个维度思考。
模型能力
先看模型基础能力。如果从多模态这个维度去看,过去的进展是比较缓慢的。一方面是在多模态这个体系里面原有的那套训练逻辑可能会面临较大的数据瓶颈,文本数据在互联网上的量是非常丰富的,图片和视频数据也有,但相比于文本类实现质变的数据要求来说,图片和视频领域的数据量需求远远大于今天的供给。因此,一定程度上是整个数据体系的匮乏,导致模型的进度比想象的要慢,这一点上仍然需要一定的时间去补充模型的基础能力。在没有大规模的数据供给之前,或者找到更新的解决方案之前,还有一定时间的能力成熟期,还需要一个过程。
应用场景的附加值
目前基于多模态应用的场景在一些维度上实际上已经开始尝试了,不管是文本、语音、图像还是视频,但是大家的解决方案和思路都是基于场景化的方案。因此,各家也是在这一套逻辑里面去进行场景优化和能力提升。但在不同的场景中今天获得的附加值还不足够高,或者在 C 端的商业化价值维度上看起来还不够突出,所以也没有找到特别好的突破路径。附加值足够高的情况下,才会有更多的资源和时间投入到这个领域的研发,附加值没有那么高的情况下,可能大部分都会选择观望。接下来我们要在多模态这个技术成熟度还不够的情况下,在高附加值的场景去进行应用,可能才是一个有意义的方向。但今天仍然处于一个探索的过程,还没有谁说他找到了一个附加值足够高的场景。
探索高附加值场景
可能接下来更多维度的产品在不同的用户场景上去尝试,才有可能找到更多的可能性。今天在这个维度的范畴尝试还太少,当然可能还面临到一些别的因素,比如说一旦其能力得到扩展,面临的审核压力和服务成本就会增加,在这一点上基础设施的能力可能是够的,但是对于服务的优化和可控性上面仍然需要更多有针对性的解决方案,若附加值不高则可能还不能完全投入。在一些特定附加值高的领域还是有一定的进展,比如教育或色情场景。
技术整合与应用挑战
当然,更细节的问题是不同的技术能力和模型能力之间的关联和应用,这可能在具体的场景里面会有多种不同形态的整合,这也是接下来应用需要面对的问题。
交互载体的进化
第三是整个多模态的应用场景来说,因为它丰富的交互形式和更加接近自然的交互形态,比如说语音、图像、视频,在这些交互形态里面,今天的硬件载体还是一个比较早期的阶段。不管是耳机、眼镜、头盔还是手表,一定程度上硬件的快速普及和场景的普适能够增加多模态应用的普及速度。多模态的核心能力整合起来能够跟硬件做更优的场景整合,得到的附加值大于它今天只在单一的不管是手机还是电脑上的产品形态,所以如果想要到更广泛的应用成熟度,一定程度上需要靠硬件的助推,它不仅是一个新型的呈现、显示和形态的问题,更多的还是一些要重新定义交互或者人机沟通的逻辑,在这一点上硬件也起到一个相对关键的作用。
AI 眼镜的潜在影响
今年会有密集的 AI 眼镜或者这一类型的产品出来,可能能一定程度上解决数据输入的问题,看明年有没有机会出一个类似的场景比较结合,或者跟硬件绑定比较紧的更好的产品。
关键要素的成熟度与展望
所以,如果从这三个维度去看,无论是基础的模型能力,还是应用场景的成熟度,以及是整场景延展和硬件生态的发展。目前看起来还不是一个各个要素都能到 60 分的状态,一定程度上是一个要素足够成熟,能带动另外两个要素的发展;或者是几个要素都同时成熟,才能带来一个新的阶梯式的变化。从这个维度上来说快的话半年到一年,看这个关键要素变量来源于哪里,目前看起来,可能模型和硬件是关键变量,应用和场景可能还需要一定的时间。
如果都不成熟怎么办?都不成熟那我们就等一等,或者今天去做。