今年5月,华东某市破获一起黑客爬取电商平台数据案。嫌疑人写了个自动化脚本,专门绕过平台的反爬与鉴权防护,把商品ID、未公开定价、实时库存这类核心字段批量抓取,累计上百万条转手倒卖,获利五十余万元,六人被抓,其中五人被以非法获取计算机信息系统数据为由移送。无独有偶,东南沿海某地6月也有短剧平台被植入木马,有人借机套取积分奖励,企业直接损失二十余万元。
一、法律边界先看清
这类事的核心,不在"爬没爬",而在"怎么爬、爬了什么"。公开页面里能被正常访问的信息,一般不构成问题。但绕过验证码、伪造设备指纹、盗用他人账号或内部权限,去拿本不该公开的数据,性质就完全不同。内外部勾结、把内部账号转交外人再配合爬虫绕过反爬,同样踩线。
把上面几种情形归拢一下,互联网企业常见违法行为大致分三类。一是越权抓取非公开数据,二是内外勾结泄露数据,三是用木马、外挂类手段侵入系统。技术团队得先认清楚自己处在哪一类,再去谈防护。判定越权的关键,是看数据是不是靠突破技术措施才拿到的。按协议带身份访问公开页,和伪造令牌进后台,是两回事。前者多落在民事与行政范畴,后者才容易触到刑事那条线。技术负责人要做的,是把公开和受限在数据层面切清楚。
二、开发者常踩的坑
坑一,把"能爬到"当成"能卖"。很多人觉得数据又不是自己生产的,抓来转手没事,实际上数据来源和授权链条才是关键。接口返回的数据能不能二次分发,合同和授权里写得清不清楚,决定你是不是善意。
坑二,内部测试账号外借。员工把运维或后台账号交给外部人员,对方再用脚本绕反爬,责任会同时落在出借人和使用人头上。权限边界一旦模糊,外人的脚本就能顺着你的账号进去,锅就甩不掉了。
坑三,忽略数据分级。没做字段级权限,库存、定价这类敏感字段和公开陈列混在一起,出事时根本说不清哪部分是公开、哪部分越权。字段不分级,等于把机密和普通信息放在同一个篮子里,泄露时没法做切割抗辩。
三、该怎么做:分步骤把功课做在前面
先做数据资产梳理。把系统里的字段按公开、登录可见、内部受限三级打标。为什么:出事时能用清单证明你区分了权限边界。做错会怎样:混在一起,越权部分和公开部分被一锅端认定。留痕:形成一份带版本号和审批人签字的数据分级表。
给抓取行为设白名单与频控。对外接口明确允许哪些字段、什么频率,超阈值的请求直接限流或拦截。为什么:证明你建了防护而不是放任。做错会怎样:无防护等于间接默许,责任更难撇清。留痕:在接口网关配置里留策略版本和变更记录。
管住账号权限。内部账号实名制、必要权限、定期回收。员工离职或转岗当天收回令牌。为什么:账号出借往往是从权限失控开始的。做错会怎样:出借账号成了他人越权的跳板,你脱不了干系。留痕:权限申请审批单、回收操作日志。
建爬虫合规审查点。任何对外采集需求上线前,过一遍"数据源是否授权、字段是否越级、用途是否告知"三问。为什么:把法律风险前置到开发环节。做错会怎样:上线后再补,证据链已经断了。留痕:需求评审纪要里写明合规结论。
留存操作与授权证据。谁在什么时候用什么方式拿过什么数据,全程留日志并定期归档。为什么:纠纷来了,日志是证明你清白的关键材料。做错会怎样:口说无凭,解释权不在你手里。留痕:只读归档日志,防篡改。
四、审判视角软提醒
我做刑事审判三十七年,坐在审判席上见过不少这类案子。技术人常以为自己只是写了几行代码,没碰钱就没事,可一旦越权拿到的数据量过了法定门槛,定性就不由写代码的人说了算。代码是中性工具,怎么用、用在什么边界上,才是法官盯的地方。
韩宝玉,北京百环律所深圳办案团队,曾任某省直属法院高级法官,从事审判工作37年。
本文为普法内容,不构成针对具体个案的法律意见。