破解智能体接入本地生活服务的痛点,PhysiClaw 寻求天使轮融资
让 AI 物理操作手机,直接触达本地生活服务。
智能体已经能够独立写出高质量代码、求解悬置多年的数学难题,但若让它代订一张火车票、点一份外卖,多数智能体仍无从下手。差距不在模型能力,而在接入权限:国内常用的本地生活类应用大多不向个人用户开放接口,智能体无从调用,任务自然难以闭环。智能体的能力边界,很大程度上取决于它所能触达的服务边界。
PhysiClaw 要解决的就是这件事:凡是用户能在手机上完成的操作,智能体都能代为完成,且不依赖应用平台的开放接口。
技术路径是把接入下沉到物理层。一台三轴机械臂托管整部手机,摄像头读取屏幕内容,机械臂驱动电容触控笔完成点击与输入,手机屏幕本身就是接口。项目于 2026 年 3 月启动,目前已完成初代硬件原型,硬件图纸与智能体源代码均以 MIT 协议开源。现阶段,PhysiClaw 正在寻求 2000 万元人民币天使轮融资。
01 卡点在接入,不在模型
近两年大模型迭代很快,智能体已能承担代码编写、视频生成、科研辅助等复杂任务,在专业场景中的可用性明显提升。但在日常生活场景,渗透率依然偏低。点外卖、挂号、网购、订票、叫车这类高频而低复杂度的事务,仍主要依靠用户手动完成。
真正的约束在服务接入。国内高频生活类应用大多不向个人用户开放接口,少数开放的接口通常只面向企业级合作伙伴,个人开发者难以获得授权。与此同时,各平台对自动化访问的管控持续收紧,风控体系日趋严格。开发者若在软件层模拟用户操作,既可能与平台服务协议相冲突,也容易被风控识别并拦截,长期稳定性无从保障。
换言之,智能体在本地生活服务场景的落地节奏,实际上由平台生态的开放节奏决定,而后者并不掌握在开发者手中。PhysiClaw 因此转向物理层,寻找一条不依赖平台授权的通用接入路径。
02 屏幕即接口
PhysiClaw 既不调用应用接口,也不需要操作系统的特殊权限,而是用一台三轴机械臂直接操作一部完整手机。摄像头识别屏幕内容,机械臂驱动电容触控笔完成点击、滑动与文本输入。整个交互过程发生在物理层,从应用侧观察与真人操作没有区别,既不必针对单个应用做适配,也不需要用户授予额外的数据权限。
硬件采用 CoreXY 双步进电机驱动结构,占地约一张 A4 纸大小,可直接放在桌面运行,定位精度 0.1 毫米。设计图纸以代码化方式(CAD as Code)编写,与智能体源代码一并按 MIT 协议开源,开发者可自行复现、修改并二次开发。
算法层面采用三层架构,目的是控制单次任务的推理成本。端侧运行轻量视觉模型,负责屏幕文字识别与图标检测,全部在本地完成,不产生云端调用开销。中间层是百亿参数量级的 Phone Use 专用模型,负责把任务规划转换为具体的屏幕操作序列,目前仍处于研发阶段。只有在任务规划环节,以及执行失败需要接管时,系统才会调用多模态通用大模型。若每一次点击都要经过一次大模型,单次任务成本将难以支撑日常高频使用;分层设计正是为了让智能体在生活场景中具备经济可行性。
在此基础上,项目提供了宏机制,用户可以把高频操作序列预先定义为可复用脚本,智能体一次调用即可执行整段流程,进一步压缩响应时间与调用开销。
PhysiClaw 不绑定单一模型厂商,用户可自行选择云端模型服务,也可接入本地部署的模型。涉及支付等敏感操作时,系统会等待用户确认后再执行。
03 开源先行,订阅变现
商业模式上,硬件是获客入口,按接近成本的价格定价,利润主要来自后续的月度订阅服务。量产阶段的目标是把整机成本控制在 500 元以内,做到开箱即用。团队判断,个人助理产品的竞争关键在于装机量,硬件本身并不构成长期盈利来源,因此选择以开源与低价先铺开入口,再通过订阅服务与开发者生态完成商业闭环。
目标用户分两步走。初期面向关注开源智能体的开发者与技术爱好者,通过社区共建补齐应用场景生态;中长期面向有日常事务代办需求的普通消费者。随着智能体在消费端渗透率提升,个人助理入口的价值正在被重新评估,具备通用接入能力的方案存在较大的市场空间。
开源之后,项目已被技术社区收录与传播,积累了早期开发者关注度,但尚未开展规模化商业验证。团队认为,现阶段最关键的任务是持续降低推理成本与硬件成本,并提升硬件易用性。
本轮 2000 万元融资主要用于 Phone Use 专用执行模型训练、端侧视觉模型调优、量产硬件工程开发与开源社区运营,预计支撑约 12 个月研发周期,目标是在本轮资金周期内完成从原型到量产的推进。















