**来源背景**:The Android Show: I/O Edition,2026年5月12日,Google在I/O大会前哨活动上正式发布。
大家好,我是楮墨。
想象一个场景。
你路边接过一张传单,顺手拍了一张照片。
以前你的操作路径:打开相册→看着照片记关键信息→打开日历→新建事件→输入地点、时间→保存。折腾完可能还漏填。
现在:Gemini Intelligence自动识别这张传单照片,弹窗问你"提取的行程要不要添加到日历?"你点一下,完事。
这是最基础的功能。真正的大招在后面——
跨应用多步骤任务自动化。
比如收到预订单确认邮件,Agent自动创建日历提醒;或者从Gmail找到课程大纲,自动把相关书籍加入购物车;再或者拍一张传单照片,自动提取旅游行程信息。
一个意图,Agent在相关App间替你完成。
这不是Siri 2.0。这是操作系统层面的Agent化。
五大能力拆解
1. 跨应用多步骤任务自动化
这是Gemini Intelligence的灵魂功能,也是它突破iOS和安卓最大限制的关键。
以前手机里的App是孤岛。你在Gmail里看到一个课程大纲链接,得手动切换到浏览器、切换到购物App、切换到日历。App之间无法对话,本质上是因为操作系统没有"调度层"。
Gemini Intelligence补上了这个调度层。它能理解你的意图,自主在不同App之间跳转操作——但前提是这些App接入了Gemini API并遵循Google的集成规范。
Google官方演示的用例:
- 从Gmail找到课程大纲链接→自动把相关书籍加入购物车
这些场景看似简单,但背后是操作系统首次具备跨App理解用户意图的能力。
2. Chrome中Gemini浏览器使用功能(Auto Browse)
这个功能官方名称叫 Auto Browse,基于Gemini 3.1。
Gemini现在能在Chrome里帮你做:自动填表单、智能比价、抓取商品信息、多标签页操作。
但有明确限制:
这不是普惠功能,是旗舰机+订阅用户的专属能力。
3. Gemini Autofill 智能填表
基于用户授权的Google服务数据(如Gmail、Google Photos)智能填充。
不是随便一个第三方App都能读取,Gemini连接是可选设置,需要用户确认授权。
看到订票确认邮件,自动提取航班号填入相关表单。你只需要点确认,剩下的Agent帮你完成。
4. Rambler:Gboard语音输入美化
这个功能很多人误以为是会议笔记工具,错。
Rambler是Gboard(谷歌键盘)里的语音输入功能,作用是把你自然、口语化的语音实时转换成更干净、更书面的文字。
官方原话:"turns natural speech into cleaner written messages"。
支持多语言混说。你说"明天meeting几点",它直接写成"明天会议几点"——口语变书面语,而不是简单录音转文字。
解决的是"语音输入太口语化"的问题,不是会议纪要。
5. Create My Widget:自定义Gen UI小组件
这个功能最被低估。
官方名称不是"Gen UI",而是 Create My Widget。
你用自然语言描述想要的小组件,AI直接生成可交互的Widget。普通人终于能自己设计UI,不需要写代码。
"我想放一个显示今天待办的小组件"——它真的给你生成一个。
而且不止手机,这些widget可以添加到 Wear OS手表上。
竞品对比
Google的打法:在开放生态和隐私控制之间寻求平衡,而非放弃隐私。
苹果的"本地处理隐私优先"代价是功能保守。Gemini Intelligence走云端+端侧混合的路子,功能更激进,在隐私保护上也有Private Compute Core、Private AI Compute等举措。
这不是谁功能更多的问题,这是生态策略的根本分歧。
产业意义
这标志着移动操作系统从"App平台"向"Agent平台"的历史性跃迁。
过去十几年,智能手机的交互逻辑没变过:打开App→在App内操作→切换下一个App。AI再强,只是某个App里的功能。
Google打破了这个范式。
用户不再操作App,用户只需表达意图,操作系统调度一切。
对开发者的影响是根本性的:
- App不需要再做"完美界面",只需暴露能力接口。当然,这一切的前提是开发者愿意接入Gemini的API并声明App的能力接口——操作系统提供了"调度层",但App愿不愿意"上车",还得看Google能不能说服开发者。
- 如果你的App接入了Gemini生态,用户可能不需要频繁打开它
- 新分发逻辑:不是用户搜App,而是Agent根据任务自动匹配最适合的App
你产品的价值可能不再取决于月活,而是取决于被Agent调用的频率。
结尾
Google这次发布最值得关注的不在于功能多炫,而在于战略姿态。
OpenAI有Codex,但没有操作系统。苹果有操作系统,但AI太保守。Google是唯一同时拥有:顶级大模型(Gemini)+ 最大移动操作系统(Android)+ 最强浏览器(Chrome)+ 最大应用生态(Play Store)的玩家。
Gemini Intelligence是Google把这些拼图拼在一起的第一张完整图。
但也得承认,Google的AI功能历来有"发布时很炫,落地时很慢"的问题。2018年I/O上炸场的Duplex打电话订餐厅,后来基本没声音了。
这次能否真正改变智能手机的交互范式,要看开发者生态的跟进速度、用户习惯的迁移周期,以及监管审查的多重障碍。
但方向已经定了。你手里拿着的不再只是"有很多App的设备",而是一个正在学会替你办事的数字助理。
这场仗,Google押上了操作系统的未来。
你觉得谁会赢?
苹果的封闭生态 VS Google的开放策略,你站哪边?评论区聊聊。
既然看到了这里,如果觉得内容不错,欢迎点赞、在看、转发三连支持!不想错过更新,别忘了设为星标 ⭐。感谢阅读,下次再见!