【科技纵览】一张薄薄的证书,恐怕还不足以成为你立刻更换手机的充分理由。回溯至7月下旬,智能手机圈掀起了一波集体官宣热潮,多家头部厂商纷纷宣布旗下产品通过了国家人工智能L3级认证。这一轮宣传攻势的源头,是2026年7月17日出炉的首批人工智能终端智能化分级测试结果。在首批入围的移动终端中,共有11款产品达到L3标准,其中包括9部手机和2台平板电脑。华为、摩托罗拉、荣耀、vivo、OPPO、小米以及阶跃星辰等品牌均榜上有名。名单公布后,厂商们迅速将枯燥的技术测试数据转化为社交媒体上易于传播的营销语言。华为主打“首证”概念,小米强调“国家级”背书,而vivo则直接将L3定义为当前最高智能化评级。尽管各家口径存在细微差异,但这场由相似海报构成的集体预热,背后指向的都是工信部今年5月发布的《人工智能终端智能化分级》标准。那么,这个L3能力究竟意味着什么?我们何时才能真正用上这些所谓的L3手机?若参照汽车行业的标准,更高级别的L4是否就代表了完全无需人工干预的AI Agent形态?
在深入解读认证规范之前,有必要厘清两个常见的认知误区。首先,该认证依据的GB/Z 177—2026《人工智能终端智能化分级》属于国家标准化指导性技术文件,而非强制性国家标准。整个体系采用“2+N”结构,前两部分确立参考框架与通用要求,后续部分则针对手机、电脑等特定终端制定具体测试方法;其中移动终端对应的是GB/Z 177.3—2026。它提供的是行业通用的能力标尺,并非决定手机能否上市的准入红线。这也是为何我们在提及“国标”时需加上引号:它虽属国家标准体系,但现阶段主要发挥指导与评价作用。其次,L3评级针对的是具体终端及其软硬件版本,而非对整个品牌的段位评定。某型号通过L3,并不意味着同品牌所有手机自动升级;未出现在首批名单中,也不等同于测试失败,因为首批结果源于厂商主动送测,并非市场随机抽样。这也解释了为何同样在7月底官宣进入内测阶段的OPPO AI Agent手机项目“小布NEXT”,并未出现在这份名单中。换言之,L3可以作为产品卖点,但它绝非手机行业的终极排行榜。
你可能已经注意到,这套标准并非单纯针对模型能力的测试。它将终端能力拆解为感知、认知、执行、记忆和学习五个维度,下设用户感知、任务规划、工具调用、长短期记忆及情境适应等14项具体指标。将这些术语置于日常场景中更易理解:假设用户指令为“帮我安排一次周末去杭州的旅行”。L1级别仅为响应级,手机能听懂简单明确指令,调用确定工具完成单步任务,如打开日历或设置提醒,更像是一根被语音触发的手指。L2级别则为工具级,手机能理解简单意图并进行有限推理,调用预设工具完成路径明确的多步任务,如查询天气并生成行程建议,但其流程多为产品预先设定,记忆也局限于短期上下文,效果接近于手机上安装一个豆包APP。目前主流手机搭载的智能助手普遍已达到L2水平。
而厂商们普遍推崇的L3级别,则是真正的目标辅助级。手机需理解更完整的目标,在信息不足时主动追问,拆解任务并根据情况选择编排工具。它还必须具备短期与长期记忆,使得“不坐早班车”、“酒店靠近西湖”等偏好能在后续任务中持续生效。以同一句“安排杭州旅行”为例,在L3层级下,任务可能被拆解为确认日期预算、查询交通天气、筛选酒店、生成日程并写入日历。涉及付款或敏感数据时,确认权仍交还给用户。从L1到L3的差异,不在于AI回答是否更像人,而在于手机对任务的承担程度越来越完整。移动终端的测试远比演示海报具体:终端需在至少3个典型场景中接受测试,达到目标难度的工具调用任务比例不低于80%。单项任务默认需在5分钟内完成,最多有3次机会;端侧能力在离线环境测试,端云协同则在联网环境进行。此外,L3的长期记忆需覆盖至少3类信息,如用户基本信息、工具偏好或对话历史等。但复杂推理可置于云端完成,标准也未要求L3必须具备持续进化学习能力。这解释了模型与等级的关系:大模型负责理解与规划,但若仅困于聊天框,不足以让整机成为L3;反之,参数适中的模型若能与系统、接口及云端配合,亦可完成L3任务。
值得注意的是,7月15日公布的手机端模型备案名单与L3测试并非一回事。备案解决的是生成式AI服务的合规性问题,而L3测试评估的是模型装入具体手机后,能否与系统及应用协同完成任务。前者是服务底线,后者是终端能力刻度。真正参加考试的并非单一模型,而是由模型、系统、应用及权限机制组成的整体。另一个细节是,手机厂商常将L3称为当前最高等级,但这实则是一种文字游戏。L3确实是目前已有明确要求并可测试的最高等级,但并非认证体系中的顶峰。在标准细则中,L4被称为“协同级”,其具体要求标注为“待定”。面向移动终端的GB/Z 177.3—2026目前仅规定了L1至L3的测试方法。这意味着,L3级别的AI Agent手机仍是一名助手,围绕单一终端和用户目标工作。而到了L4协同级,问题将扩展至多个智能体、设备及服务主体间的协作。例如,手机能否将订票交给旅行智能体,将预算交给支付服务,并让车机、耳机共同调整计划?任务出错由谁负责?权限如何传递?这些问题尚无稳定答案,导致L4缺乏可重复的测试题。L4的空缺,暴露的不是模型能力不足,而是协同规则、责任边界及安全机制尚未成熟。因此,手机的L1-L4不能套用自动驾驶的责任逻辑,任何将L3手机包装成全自动驾驶级AI的说法,均可视为传播话术。
对于普通消费者而言,最核心的疑问或许是:为了体验更好的AI Agent能力,是否需要换新机?若严格按国标询问L3手机上市时间,答案是:已经上市。首批名单中并非全是新品,华为Pura X Max已于4月发布,3款联想moto手机也在5月亮相。当然,名单中也包含尚处发布窗口的产品,如荣耀Robot Phone。而更广为人知的豆包手机二代,并不在相关名单中。消费者真正关心的,往往不是证书意义上的L3,而是何时能买到一部能稳定理解目标、跨应用办事且不掉链子的手机。荣耀已给出明确时间表:Robot Phone将于2026年8月首发AgenticOS内核,Magic9系列计划在第四季度提供尝鲜版。原生Android方面也在推进AppFunctions和界面自动化框架,计划在今年年内发布更多细节。据此判断,2026年下半年将是消费级L3体验集中出现的第一轮窗口期;但若期待其像相机、支付一样成为主流手机的稳定能力,更现实的观察点应在2027年。Counterpoint预计,到2027年,生成式AI手机将占全球出货量的52%,智能体能力也将向旗舰产品扩展。但这并不能直接换算成国标L3的市场占比,因为两套定义不同。不过,这给出了一个可期待的换代节奏:2026年看旗舰试水,2027年看生态与中端机跟进。因此,若现有手机性能续航无虞,不必仅为一张L3证书提前换机。标准允许复杂推理借助云端完成,许多能力也可能通过系统更新抵达现有旗舰。真正决定体验的,是厂商的系统维护力度及应用开放意愿。若恰逢换机周期,L3可作为新筛选项,但更应关注真实任务成功率、常用应用覆盖范围及操作的可控性。证书证明手机跨过了一条线,却不能证明它已值得接管你的数字生活。真正值得等待的,是我们不再关心等级,只记得那句“帮我办了”之后,事情确实被稳稳办完。
L3认证落地:手机AI的“驾照”还是营销噱头?
科技区角
2026-08-06 20:32
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。