高通芯片和模型的本地化

2024-10-21

高通骁龙 8 至尊版芯片深度解析

高通骁龙 8 至尊版芯片是高通公司 2024 年推出的一款性能强劲的旗舰级移动平台芯片,有几个核心的特性:

CPU 性能

架构设计

搭载第二代定制的高通 Oryon CPU,采用“2+6”的全大核架构,即 2 颗超级内核以及 6 颗性能内核。其中超级内核主频高达 4.32GHz,适合应对需要更快响应速度的密集型应用;性能内核主频为 3.53GHz,负责运行最密集型的应用程序,每个性能内核都经过调优,具有较高能效。

性能提升

与上一代芯片相比,CPU 单核性能提升 45%,多核性能提升 45%。在全新架构以及技术优化的加持下,可确保在手机等紧凑产品外观设计下保持全天候冷静运行。并且该芯片的二级缓存达到 24MB,是目前移动领域最大的缓存,为芯片的高性能运行提供了有力支持。

GPU 性能

架构升级

采用切片架构的 Adreno GPU,主频达到了 1.1GHz,在图形处理方面实现重大升级。并且为每个切片分配了专用内存,用于图形数据的传输,减少向芯片内存发送的图形数据,提升了图形处理的效率和性能。

性能表现

图形性能方面,对于图形密集型游戏,其性能将提升 40%,功耗降低 40%。同时,光追性能提高了 35%,结合 Snapdragon Elite Gaming 的先进技术解决方案,能够为用户带来出色的游戏体验。并且该芯片首次支持了虚幻引擎 5.3,让手机游戏实现电影级 3D 环境成为可能。

AI 性能

NPU 升级

搭载全新架构的 Hexagon NPU,AI 性能提升 45%,能效提升 45%,基础大语言模型上的 token 生成速率提升了高达 100%。在目前业界流行的一些大语言模型上,处理速度达到超过 70 tokens/s,快速响应能力出色。

智能体验

用户可以打造个性化多模态 AI 助手,AI 助手在底层依靠多种先进 AI 模型支持,包括自动语音识别(ASR)、大语言模型(LLM)、大视觉模型(LVM)和全新多模态大模型(LMM),通过异构计算,这些模型在高通 AI 引擎的不同内核上运行,确保一切任务都能流畅高效地运行。例如,用户可以将手机摄像头直接对准想要了解的事物,然后对手机进行提问,手机可以基于摄像头的实时画面进行分析并给出答案,增强了用户的交互体验。

影像能力

AI-ISP

带来了全新的 AI-ISP,在自动对焦、自动白平衡和自动曝光的基础上新增了 AI 辅助的增强功能,可全面提升图像质量。像素吞吐量提升了 33%,达到了每秒 43 亿像素,这让手机可以通过三个 4800 万像素传感器以 30fps 录制零延迟快门的视频。

视频功能

支持 4K 60fps 实时的 AI 增强功能,并且可以在视频上使用 AI 魔法消除的功能,只需要在视频中选择想要擦除的对象,就可以实现消除功能,整个过程在手机本地实现,无需上传到云端,保护了用户的隐私。

连接性能

调制解调器

集成骁龙 X80 调制解调器及射频系统,通过结合 sub-6GHz 和毫米波技术,5G 下载速度可达 10Gbps,上传速度可达 3.5Gbps。

无线连接

支持高通 FastConnect 7900,支持高通 aptX 无损音频技术,可提供 24bit 48kHz 的蓝牙音乐和 24bit 96kHz 的 Wi-Fi 音乐支持。

端侧模型能力释放的亮点

这几个关键要素里其实总结起来最大的亮点在于本地端侧模型能力的释放,相当于芯片把自己的接口和能力处理好,交给其他应用来调用就行了。目前在不同领域的合作,分别选了腾讯混元和智谱 GLM-4V 端侧视觉大模型以及网易游戏做了 AI 队友的尝试。

官方合作案例

腾讯混元

骁龙 8 至尊版通过支持基于硬件的 INT4 量化技术,实现腾讯混元大模型 7B 和 3B 版本的终端侧部署,可以大幅提升腾讯混元大模型在终端侧的运行效率,例如腾讯手机管家短信智能识别功能通过海量数据结合深度神经网络与预训练,能够更准确地理解短信意图,让短信召回率大幅提高将近 200%,识别准确率提升 20%。

智谱

高通与智谱合作,为骁龙 8 至尊版适配优化 GLM-4V 端侧视觉大模型,支持丰富的多模态交互方式。终端侧多模态应用 ChatGLM 能够支持三种终端侧交互方式:使用相机进行实时语音对话、上传照片进行对话、上传视频进行对话。丰富的多模态输入输出方式赋能智能助手 ChatGLM 实现了跨家庭、出行、工作和教育等多个场景的应用,例如:通过手机摄像头获取穿搭建议,利用视觉信息实现智能导航,通过车内摄像头识别遗留物品,拍摄画作进行风格解析。

端侧 AI 带来的潜在变化

应用的 AI 服务成本大幅度降低

目前绝大多数的 AI 运行都是在云端进行,所有的服务也是在服务器端完成的,这就导致了手机只是成为了一个 AI 应用的数据输入输出接口,硬件本身不具备服务能力(有些模型有本地包)。在云端的缺点就是每次应用的服务输出都需要提交到云端来进行,响应速度和体验上都会有折扣,更重要的是服务成本也高,如果在芯片端完成了一部分服务的输入输出,未来的应用开发只需要在本地增加一个输入输出服务的判断,判断服务是由本地的模型来完成,还是需要提交到云端的服务能力完成,就会大大的降低应用的服务成本。

服务的响应速度大幅度提高

提交到云端的服务处理,除了本身的成本之外,还有一个问题就是对外部条件的要求比较高,比如说网络速度,响应速度,还有云端的服务速度等等。这就带来了一些缺点是服务只能是相对异步的。小信息量和并发量的服务可能能够实时输出,但是多信息和并发的服务就可能会有一定输出的上的延时,如果完全是本地的话,响应速度就会大幅度的提高,基本上意味着一些简单的 AI 服务可以做到实时提供。比如日常对话,一些内容意图的识别等等。

部分 AI 硬件的 AI 能力可本地化

目前一部分 ai 的。 Ai 硬件本身只作为了一个数据的输入和服务的输出端口,甚至一部分只具备了数据的输入端口服务本身都是需要承载到云端来完成的。而如果本身硬件不具备通讯能力作为手机的附属的话,这一部分服务对于手机本身的功耗要求和数据传输能力也是一个考验未来如果手机本身具备端测的处理能力,那手机的附属 ai 硬件只需要调用手机端口就不存在网络延时和功耗的问题,这一点上又会解放出一批新的硬件,带来新的能力和场景,比如说智能眼镜或者智能耳机。

多模态的视觉输入输出做到实时响应可用

本地化更重要的一个优势是在于以前对于多模态能力由于对于传输带宽和响应速度的要求是几乎很难做到实时化的,所以也就在大部分的场景里会受限,但是如果芯片本身能够在本地完成处理的话,那多模态的实时能力就几乎可以实现了,比如类似智谱提供的本地的视频交互的输入和输出,以及未来在一些实时的视频场景里交互的成本降低和延时降低带来的新体验。

纯粹离线部署降低模型使用成本

未来的一个思路是如果芯片本身能把模型纯粹部署到离线可用,而且场景的优化又非常的具体和精确。那模型的使用成本和一些使用场景包括在硬件上的集成就会被大大解放,比如说幼儿教育,陪伴型玩具,学校的 AI 教室,健身房的 AI 教练。场景越剧想,越清晰对于模型本地部署的要求就越精准,服务的有效性也就越好,进一步成本也就会降得更低。

返回首页 · 全部文章 · 专题 · RSS