
资源导航
论文链接:https://arxiv.org/abs/2605.05765
项目主页:https://github.com/OPPO-Mente-Lab/X-OmniClaw
GitHub Repo:https://github.com/OPPO-Mente-Lab/X-OmniClaw
Hugging Face:暂未上架(APK直接从GitHub Releases页获取)
发布机构:OPPO AI Center · Multi-X Team
发布日期:2026年5月7日(arXiv预印本)
开源协议:Apache License 2.0(商用与修改均允许,需保留声明)
移动端AI Agent这个方向起点大概是从2024年秋季说起。
那时候,Anthropic发布了Computer Use,同一时间智谱发布了AUTO-GLM,到后来的努比亚M153豆包手机、阶跃星辰的GELab-zero、阿里的MAI-UI、Mobile-Agent-v3.5等等越来越频繁出现在公众视野中。(写过好多不再一一赘述了)。
再到后来OpenClaw在GitHub上以极快的速度蹿红——这个PC端的开源AI执行框架,让很多人第一次感受到"让AI真正替你干活"是什么感觉。但OpenClaw骨子里还是一个服务器程序,要在手机上用,只能绕着走:Termux、Telegram机器人、公网穿透……门槛说不高也不低,普通用户折腾一圈往往放弃。
然后红手指Operator来了,把类似的能力封进了安卓App,云手机接管操作界面,不用折腾环境配置,一句话让AI去买票、订外卖。这是云端路线:AI在远程云机上运行,你的手机只是个遥控器。有便利,但也有显而易见的代价——本地相册、本地摄像头、本地系统配置,全都够不到。
OPPO AI Center这次开源的X-OmniClaw,走的是另一条路。
直接把Agent装进你手机里。不是远程云控,是真机运行。
它能看你的相机、听你的语音、读你的屏幕,然后跨App去帮你完成任务。
从项目定义说起。
X-OmniClaw是一个多模态安卓端Agent,运行在真实物理手机上,支持Android 8.0及以上系统。不依赖云手机,不需要在服务器上另开虚拟机,逻辑全在你手边的这台设备上跑。
名字里的"Omni",指的是它整合了三类感知来源:屏幕内的UI状态、屏幕外的真实世界视觉(摄像头)、以及语音输入。"X-"强调跨模态融合——这三路信号被统一组织成一个输入流,驱动真实手机里的跨App执行。
技术报告把整个系统总结成三个核心能力:
Omni Perception(全感知)——看得到、听得到、懂你在说什么。
Omni Memory(全记忆)——不只记着当前任务,还能从你的本地数据里蒸馏出长期个人记忆。
Omni Action(全行动)——把高层指令翻译成具体的Android操作,还能把你用过的操作路径录成可复用的技能。
这是整体框架图(论文Figure 1):

↑ 语音、屏幕、摄像头三路输入,经过Agent循环,转化为设备操作,再沉淀为记忆——整个闭环都在你的手机上完成。
README里放了四个GIF演示,对应三条主线。
用户指令:「这瓶水在淘宝上卖多少钱」
执行过程:Agent先看摄像头画面,识别出这是一瓶依云矿泉水;然后自动启动淘宝,搜索"依云矿泉水",滚动结果页截图,提取价格和销量,最后给出带数字结论。
↑ 从"看实物"到"搜电商"再到"给结论",全程无需用户手动操作。
这个场景的亮点不是技术多复杂,而是把"现实世界感知"和"数字世界操作"打通了。以前你只能在App里搜文字,现在把东西对着摄像头,它自己去查。
用户指令:「开始做题吧。」
执行过程:Agent跟随当前投屏/界面,用户在哪页它就看哪页;用户按住语音触发后,结合屏幕内容理解任务;长任务按步骤连续推进,边执行边看反馈并调整。
↑ 屏幕内容和语音指令融合理解,不是简单的截图问答,而是持续跟随执行。
这个场景里"语音+屏幕"的时间对齐设计体现得比较明显——你按下说话那刻的画面会被记录下来,作为理解你意图的视觉背景。
用户指令:「帮我找到与鹦鹉主题相关的照片并一键成片。」
执行过程:先在后台把相册整理成"可按主题检索"的记忆清单,再按"鹦鹉"关键词挑出候选照片;把选中的图集中到临时相册(A\_latest),避免在全相册里逐张翻找;自动跳到剪映一键成片页,批量勾选照片,必要时点"跳过分析",进入导出流程。
↑ 相册记忆检索 → 临时相册归集 → 剪映一键成片,三个App无缝串联。
这个演示连了三个不同的App,也是目前Agent执行链比较容易出问题的场景——跨App跳转、广告弹窗、界面结构变动都可能打断流程。混合UI理解(XML+视觉)在这类场景里起到稳定作用。
用户指令:「打开美团秒杀」
执行过程:先录制一次"从美团首页导航到秒杀页"的完整轨迹,沉淀为可复用的书签/技能;之后说一句话,直接启动到目标页;如果启动失败,自动降级兜底。
↑ "录一次,以后一句话直达"——把长路径压缩成可复用的入口。
这个功能的实用性在于,手机App的深层页面往往要点好几步才能到。录下来之后,以后只要说一句话,剩下的路Agent帮你走完。
先说几个经常被放在一起比较的方向。
OpenClaw:PC端,本质是个服务端程序,手机只能当遥控器用。它在技能体系和工程架构上做得比较成熟,但真正"进到手机里"这件事,它并没有做。
豆包Phone类云手机方案:把Agent跑在云端的虚拟安卓机上,用户手机只是个显示和交互入口。好处是上手简单,缺点是本地传感器、本地数据全部访问不到,还要维护一个云端身份。
红手指Operator:应用层Android Agent,直接安装在真实手机上,通过无障碍服务实现跨App操作,不需要云手机——但核心AI推理同样依赖云端API,思路与X-OmniClaw类似,区别在于定制化深度和技能体系的完整程度。
AutoGLM 2.0:走的是云手机路线,把AI行动舞台放在云端虚拟设备里,真实手机只负责下发指令。
OneClaw:受OpenClaw启发,有开发者用Claude Code独立做出来的Android原生Agent App,思路类似,但完整度和工程深度目前与X-OmniClaw不在同一个量级。
UI-TARS / Mobile-Agent等研究型框架:学术性强,主要跑在AndroidWorld、OSWorld这类仿真环境里,实机落地方面的打磨相对有限。
X-OmniClaw的定位比较明确:原生安装在真实手机上,直接调用Android系统能力,同时接入云端大模型做推理,本地负责感知和执行,云端负责"想清楚下一步干什么"。技术报告里用了一个比喻:手机是车,X-OmniClaw是引擎,云端大模型是燃料。
这个架构的优势是,它能真正访问你的本地摄像头、麦克风、相册、系统设置;局限是,比较依赖云端API,没网或者API出问题了,执行链就断了。
这一层处理的是多路输入的融合问题。
输入来源很多样:应用内的UI交互、悬浮窗按钮、麦克风语音、摄像头画面、定时任务触发器,甚至飞书/Discord等外部频道的消息。所有这些都汇入同一个入口。
有意思的设计细节是时间对齐。你按住说话那一刻的屏幕画面,会被和语音输入对齐,一起作为决策依据。这样Agent不只是听你说了什么,还知道你说话时"看到的是什么"。
另一个细节是自适应回声消除(AEC)。手机同时播音和录音时,系统会主动抑制自身声音的干扰,确保收到的语音信号是干净的。
还有一个"场景接地"的设计:当你的输入进来时,系统不会立刻触发执行,而是先用VLM理解当前画面和你的问题,判断能不能直接回答——如果能,就直接给你答案;如果不能,才把任务拆解下发给执行循环。
这有个好处:避免把每个问题都当成"要去操作App"的任务。问一句"现在几点了",没必要去开时钟App。
感知层的整体架构(论文Figure 2):

↑ 多模态入口、多模态感知、场景接地意图理解,三层结构。
这是X-OmniClaw里相对独特的一块。
分两层:工作记忆和长期个人记忆。
工作记忆负责维持当前任务的上下文。它不只是文字历史,还包括截图作为视觉证据、任务进度状态、压缩过的语义摘要。App切换了、任务中断了,工作记忆帮助Agent重新接上去,而不是重头来过。
长期个人记忆更有意思。系统会从你的本地数据里——主要是相册里的照片和交互轨迹——蒸馏出结构化的语义记录:这张照片拍的是什么场景、有哪些对象、和哪个时间段相关。这些记录可以支持后续的"按主题找图""生成个人画像"等操作。
技术报告里特别提到了数据安全的处理:写入长期记忆之前,系统会做统一的过滤和脱敏;用户可以手动控制相册记忆是否开启、个人画像是否注入到后续决策里。另外,未来的方向是把视觉语义摘要的推理也迁到端侧完成,减少原始图片上传到云端的风险。(目前这块还在演进中,实际使用时建议留意自己的隐私偏好设置。)
Omni Memory的架构(论文Figure 3):

↑ 工作记忆维持任务连续性,长期记忆从本地数据蒸馏出个性化上下文,两者协同。
执行层的设计有两块:App生态内的操作循环,和轨迹克隆执行。
操作循环:每一步都遵循"观察→推理→执行"的最小闭环。
观察阶段,系统构建一个混合界面证据栈:优先使用Accessibility Tree(结构化的XML信息),同时用视觉模型和OCR做视觉兜底。为什么要混合?因为很多App的XML信息不完整,广告页、弹窗、图形化界面这些地方,纯靠XML可能点不准。视觉理解作为补充,帮助定位那些结构信息缺失的元素。
推理阶段,大模型理解当前页面状态,判断上一步执行结果,选择合适的技能或工具,决定下一步是继续操作还是直接回答用户。
执行阶段,通过Android原子动作完成点击、滑动、文本输入、应用切换等操作,也支持文件系统操作和RAG等高级工具。
这个循环会持续重复,直到任务完成或达到预算上限被停止。失败时系统会尝试收敛,而不是直接报错退出。
轨迹克隆:这是第二块,也是比较实用的功能。
用户手动操作一遍某个流程(比如进入美团某个活动页),系统把这条操作轨迹记录下来,生成一个可复用的"技能"。以后直接说"打开美团秒杀",系统就按照上次记录的路径直接跳转,不用每次都从头导航。如果启动失败,会自动降级兜底,尽量复现上次的目标页面。
Omni Action的整体架构(论文Figure 4):

↑ Agent循环(左侧)和轨迹克隆执行(右侧)两条路径,前者处理动态任务,后者处理高频固定流程。
本地引擎架构示意(README原图):

↑ 感知、策略、执行、验收四层结构,全部跑在手机本地。
内置技能通过app/src/main/assets/skills/目录按需加载,目前包括:
用法很直接,直接对Agent说就行,比如:
skill-creator技能比较有意思:执行成功一次之后,可以让Agent把这个操作方法总结成新技能,下次直接复用。
这是X-OmniClaw和完全本地化Agent的一个区别:大模型推理依赖云端API,不是端侧模型。
技术报告用汽车比喻解释了这个设计:手机是车,X-OmniClaw是引擎,云端大模型是燃料。本地负责感知和执行,推理层按需调用云端。
支持的云端提供商包括:
另外还需要单独配置语音STT和视觉VLM。STT官方示例用的是硅基流动+FunAudioLLM/SenseVoiceSmall,目前这条线路有免费额度可以用(以服务商当期策略为准)。VLM需要支持图像输入的多模态模型,可以和主模型用同一个提供商,也可以单独配置。
配置流程:打开应用 → 进入「模型配置」→ 填写Agent主模型的API Key和Base URL → 保存;再进入STT和VLM配置页分别填写。保存后配置写入/sdcard/.xomniclaw/xomniclaw.json,一般不需要手动编辑这个文件。
需要授予7项权限:无障碍、悬浮窗、录屏、相册、全部文件访问、摄像头、麦克风。权限比较多,这是因为功能覆盖了从视觉感知到系统操作的全链路。
外部频道方面,支持接入飞书和Discord Bot,可以从这些渠道发指令触发手机上的操作。
APK直接从GitHub Releases页下载安装:
https://github.com/OPPO-Mente-Lab/X-OmniClaw/releases/latest
安装完成后按上面说的配置模型API Key,授予权限,就可以开始用了。
不需要额外的服务器或开发环境,普通用户装APK就行。
如果想自行从源码构建,环境要求是JDK 17以上、Android SDK、Gradle。
git clone https://github.com/OPPO-Mente-Lab/X-OmniClaw.gitcd X-OmniClawcp local.properties.example local.properties"color:#9ca3af;"># 设置 sdk.dir 指向本机 Android SDK./gradlew :app:assembleDebug输出APK路径:releases/X-OmniClaw-v-debug.apk
目前代码已开源(Apache 2.0),模型本身不在仓库里,大模型推理走的是外部API,所以不存在"要不要下载几十GB模型权重"的问题。
多会话并行:2026年4月上线了会话级隔离,多个任务可以并行跑互不干扰,每个会话有独立的Agent主循环,可以按会话单独停止。
定时自动化:2026年3月支持了按间隔、工作日或周计划执行任务,覆盖息屏和亮屏场景。这个功能实际跑起来的稳定性取决于手机厂商对后台进程的管控策略,部分机型可能需要手动设置"不受限制的后台运行"。
隐私:相册记忆需要用户手动开启,个人画像注入也可以关闭。但由于推理依赖云端API,操作过程的截图和文字描述仍会通过API传出去,使用前建议清楚这一点。
执行稳定性:跨App操作本身是个不确定性高的任务——App更新、广告弹窗、权限弹框,随时可能打断执行链。项目目前在持续迭代,执行策略已经在2026年4月做了一次较大收敛(确立了"纯文本可本地直返、凡设备操作统一走智能体"的主路径),稳定性相比早期版本有改善,但遇到复杂页面仍可能需要重试。
模型选择:因为要处理截图,主模型必须支持多模态(图像输入)。如果只填了文本模型,视觉相关功能会失效。
移动端AI Agent这个方向,2026年争议不少。
一方面,从用户需求角度,确实有大量重复性、跨App的操作可以被自动化——查价格、搜资讯、定期整理照片、按固定路径跳转——这类任务被Agent接管之后,效率提升是直接可感知的。
另一方面,执行链的可靠性始终是个难题。移动端App的界面更新频繁,XML结构因厂商而异,广告和权限弹窗这些"意外插入"随时出现。云端依赖也意味着,离线场景下功能大幅削减,高频操作还有API费用的考量。
对比云端方案(云手机)和原生本地方案(X-OmniClaw这类),本质上是在"隐私/本地数据访问能力"和"上手门槛"之间做权衡。云端方案确实更容易上手,但永远无法访问你手机里的真实摄像头和本地相册;本地方案能力更完整,但配置、权限、稳定性都需要用户自己管理。
X-OmniClaw选择的边缘原生路线,在能力边界上是更完整的,但也意味着在工程复杂度和用户门槛上需要持续打磨。
采用Apache License 2.0。
商用和修改均允许,但需要保留原始声明,并注明对原版本的改动。如果你基于这个项目做了修改版,不能去掉Apache 2.0的标注。
X-OmniClaw是OPPO AI Center开源的原生Android多模态Agent,核心是把感知、记忆、执行三块能力整合到一个真实手机上跑的应用里。
它跟云手机方案最大的差异,是能访问本地摄像头、麦克风、相册这些真实硬件;跟OpenClaw这类PC框架的差异,是直接作为安卓App安装,不需要另起服务器。
功能上,四个演示场景覆盖了相机识物+电商询价、屏幕跟随+读屏作答、相册主题找图+一键成片、行为克隆+一句话直达这几条比较实用的路径。
当前处于早期开源阶段,执行稳定性和功能覆盖还在持续迭代。Apache 2.0协议意味着研究者和开发者都可以直接基于它做二次开发。
如果你对移动端AI Agent这个方向感兴趣,可以直接从GitHub Releases下载APK体验,不需要复杂的环境配置。配置好云端模型API Key之后,授权完成就能开始跑。
这个方向能走多远,现在还很难说。但至少,OPPO这次把一个完整的工程实现开了出来,是这个赛道里比较少见的来自手机厂商的开源贡献。
图片来源:arxiv.org/html/2605.05765v1(Figure 1-4),GitHub OPPO-Mente-Lab/X-OmniClaw(本地引擎架构图、Demo GIF)