作者 | 肖汝健
编辑 | 周伟鹏
前几天的苹果发布会上,iPhone被定位成“智能个人中枢”,现场还秀了一波Siri读懂个人信息、直接替用户办事。
但国行用户用上新Siri还遥遥无期,同样定位的第二代“豆包手机”却要开卖了。
9月14日,豆包手机助手消费者版本正式发布,首款搭载该版本的手机努比亚NaviX Ultra已开启预约,9月16日正式开售。

官方已经确认,NaviX Ultra机身厚度只有7.62mm,却塞进了一块7100mAh电池。
此前爆料称,它还将搭载骁龙8Elite Gen5、6.78英寸1.5K 144Hz直屏和四颗5000万像素摄像头。
相比去年底的技术预览版,新版豆包手机助手更强调稳定性和日常可用性。
此前最受关注的“操作手机”能力得以保留,AI键、屏幕理解和记忆能力也都做了升级,还加入了任务排队、自动指令等新功能。
简单来说,豆包手机变得更聪明,也能做更多的连续任务了。
不过,官方也明确提醒,这些能力存在一定风险, Agent、跨App生态、任务稳定性等方面也有待完善。

能听、能看,豆包还想记住你
去年初代豆包手机亮相时,豆包已经可以通过语音和AI键直接唤醒,理解当前屏幕上的内容,再根据用户指令继续操作手机。
比如看到商品,可以继续帮用户比价、下单;想买车票,也能在不同App之间切换,查找合适的班次。
到了消费者版本,这些能力变得更顺手了。
上一代就有的“侧边AI键”,本身是豆包的快捷入口,可以直接唤醒助手,双击还能调用语音、视频通话和屏幕共享。
到了这一代,AI键又加入了指纹功能。按下AI键的同时就能确认是本人,不用先解锁手机,再让豆包办事。

同时,喊豆包也更容易了。
这一代则针对远距离、手机内部噪声和嘈杂环境做了优化。
比如,做饭的时候,哪怕手机离得有点远,锅里还在滋滋冒油,也可以直接喊一句:
“豆包豆包,韭黄要炒多久啊?”

除了听得更清,豆包也更会看了。
上一代豆包手机,已经能够理解手机屏幕,比如刷到一张风景照,可以直接问豆包这是哪里。
这一次进一步扩到了对真实环境的理解。
比如把摄像头对准房间,说一句“按照这个装修风格,帮我找一个1.2米以内、价格不超过1000元的柜子”。
它就会结合画面和要求,直接去找合适的商品。
和上一代逐个打开购物App搜索、比价不同,从这次演示来看,豆包直接返回了符合要求的商品和链接,省去了中间的操作过程,速度也快了不少。

再比如,打开新学期的课表,也能一句话让它把课程添加到日历中,不用担心早八全靠舍友叫醒。
这些都还只是基操,这一次的豆包手机,还想更好记住你。
此前,豆包手机已经有了“全局记忆”的功能,看到想保存的内容,可以三指上滑,或者直接告诉豆包“记一下”。
消费者版本则进一步强化了个人Context,能更主动地利用手机里原本就有的信息。
在用户授权后,相册、短信、便签、录音、联系人和日历等本地内容,都可以成为豆包理解用户的上下文。
比如突然想不起港澳通行证什么时候过期,可以直接问它。它会把图库里的证件照找出来,告诉你答案。

再比如,昨天采访时对方提到的某个点忘了,也不用重新翻录音、把文件丢给AI总结,直接让豆包去找就好。

不过,官方也承认,个人记忆仍是一项需要继续探索的能力,这部分功能还在不断完善中。

不用一直盯着,豆包自己跑任务
豆包这次,也把最有辨识度的“操作手机”保留了下来,只不过依然是测试(Beta)版本。
去年技术预览版里,豆包已经能理解屏幕、模拟点击,在不同App之间完成任务。
不过上线没多久,这套能力就碰上了很多应用的风控,部分操作随后被收紧。
这一次,豆包没有放弃直接操作屏幕,但为此推出了屏幕自动化操作声明协议 SAEP。
简单来说,第三方App可以自行声明AI的操作边界,明确拒绝的,豆包不会自动操作。
同时,消费者版也接入了更多第三方服务和系统接口,一些任务不再需要逐步模拟点击。
比如出门时,可以直接说一句“打车到屏幕上的地址,中途经过盈都大厦”。
豆包会直接调用曹操出行完成叫车;上车后,还能接着把车牌号发给飞书里的同事,提醒对方10分钟后下楼。

值得一提的是,豆包还新增了任务排队和插队功能。前一个任务没跑完,也可以继续交代新的事情;锁屏以后,也能直接查看任务进度。

此外,快捷指令和自动指令也一起上线。
前者可以用一句口令启动一套固定操作,官方演示中,一句“晨间简报”,就能让豆包汇总天气和日程,再整理 AI 新闻。
后者则能根据时间、地点或事件自动执行,比如“一到家就打开空调”这种任务。

懂你越多,权限也越大
豆包手机越像一个私人助手,需要接触的信息也就越多。
隐私方面,官方表示,在数据收集和处理上,遵循“合理必要”和“用户自主控制”原则。
相册、短信、录音、日历等本地信息,需要用户授权才能调用;保存下来的个人记忆,也能随时查看、修改和删除。
对于Agent能够执行的操作,豆包也做了分层、分级管理。涉及支付、隐私等敏感操作时,需要用户进一步确认。
这些限制并不是多此一举。
就在9月8日,ChatGPT一项跨账户漏洞被披露。
研究人员发现,攻击者可以通过隐藏通道,给其他用户的ChatGPT偷偷下指令。
如果受害者已经连接邮箱,攻击者甚至可能借助ChatGPT读取邮件内容,再把数据传回自己的账号。相关漏洞目前已经被关闭。
过去,对于多数普通用户来说,和 AI 交互主要还是聊天记录和主动上传的内容。
现在,Agent开始连接软件和各种第三方服务,能拿到的信息越来越多。更何况,手机可能是我们一天里最离不开、也装着最多私人信息的设备。
手机 AI 真正的考验,可能已经不是能替用户做多少事。
而是当它越来越懂你、权限越来越大时,你能不能始终知道它在做什么,有没有最后的控制权。
•END•
Question. Write.Narrate. Believe. Become a story.易简传媒的愿景是提问和传播商业故事,让读者更开阔,更聪明。有 2500 万微信粉丝关注我们的账号,欢迎大家关注: