技术 · 熟练
让它用你的登录态,还是给它一把钥匙
网页自动化的门槛从来不是点击,是登录
让 agent 替你操作网页,真正卡住的很少是「会不会点」,而是「以谁的身份点」。过去两条路都不好走:自己重登一遍 ⇒ 你要把密码或令牌交给它,还得陪它过风控;什么都不给 ⇒ 它只能在登录页前面停下。现在多了一条更省事的路:让 agent 借用你那个已经登录的浏览器 —— 它在独立的可见窗口里跑、只借它需要的标签页,你照常干自己的活;碰到验证码或登录,它把手交回给你,处理完再继续。这一页把这条路的三个前提和一条不适用边界写清楚 —— 尤其是最后那条:它借的是你的身份,所以你也得给它一张「哪些动作必须你点头」的清单。
方法 · 一图看懂
1
分成两个窗口 — agent 在独立可见窗口跑,不抢占你正在用的那个
2
只借它需要的标签页 — 不是接管整个浏览器,也不关掉你的页面
3
遇阻交还 — 验证码 / 登录 / 二次验证 ⇒ 交回给你,你处理完它继续
4
配一张审批清单 — 它借的是你的身份,能用你权限做的事它也能做
5
分清能借与不能借 — 你在场时才适用;无人值守的定时任务要另一条路
原理 · 为什么有效
自动化的动作分两层:交互层(点哪里、输什么) 与 身份层(以谁的权限说话)。工具进步主要解决的是交互层 —— 把页面变成一张可读的控件表,一次调用就定下动作与文本,于是「点得准」不再是瓶颈。而真正决定这条路通不通的是身份层:与其把凭证搬给 agent(搬家过程本身就要存、要传、要轮换,还要应付异地登录风控),不如让它借用本机已经存在的那份登录态 —— 凭证不搬家,会话不重建,风控也不会被触发。代价也很清楚:它继承了你的全部权限,所以审批这一层不能省。
适用场景
适用于:你要在场、且任务里有登录态的场景 —— 在自己电脑上跑一次性的抓取 / 填表 / 对账 / 发布 / 后台操作,尤其是网站没有开放接口、或者开放接口要单独付费与审批的时候。
不适用于:无人值守的定时任务 —— 你不在场,没有人能接验证码,会话过期也没人重登 ⇒ 这类要走专门的服务账号 + 凭据管理,而不是借你的个人登录态。也不适用于要长期稳定跑的业务流程:借来的登录态随时可能因为改密码 / 换设备 / 风控而失效,稳定性远不如开放接口。
自测 · 5 问
它跑在哪个窗口?会不会正好抢掉我正在填的那一页?
它需要打开的标签页,是我指定给它、还是它自己逛出来的?
遇到验证码或二次验证时,我知不知道它停在哪一步、该从哪接手?
它被允许做的动作,我有一张写下来的清单吗?
这件事是「我在场时做一次」,还是「以后每天自动跑」?
怎么上手 · 验证步骤
先用一件事试,而且挑没有对外后果的那件 —— 比如把某个后台的一页数据导出到本地。跑之前定三件事:① 它在哪个窗口跑(新开一个,不要用你正在用的)· ② 只允许它碰哪些页面(能说出域名或页名,而不是「随便逛」)· ③ 卡住时怎么办(约定一个它会明确说出口的暂停点,而不是自己重试到乱)。跑完把这次用到的页面与动作记一行,下次这一行就是你审批清单的起点。
做完自己核三样:① 整个过程里,有没有出现过一个我没批准过的对外动作(提交 / 发送 / 支付 / 删除)② 卡住的时候,它是不是明确停下来等我,而不是自己反复重试 ③ 事后能不能说清「它用了我的哪些权限、碰了哪些页面」—— 说不清就说明这一步还没到能交给它的程度。