上周在Cursor里让AI帮我盯竞品的价格,随口说了句"去看看XX品类亚马逊热销榜的价格分布",十几分钟后它真的拉回来一张表。搁一年前,这种活得先写脚本、配代理、处理验证码,折腾两三天。现在思路完全变了:数据获取这层交给专门的工具,Cursor只负责指挥和加工。分享下我现在跑通的几条路子。
路子一:MCP,最顺手的方案
注册亮数据账号拿API密钥,装好Node.js环境后,在Cursor的MCP设置里把brightdata-mcp的配置粘进去,也可以直接终端跑一句 brightdata add mcp --agent cursor,它会自动写进 ~/.cursor/mcp.json,已有的配置不受影响。之后新建Agent时勾上这个MCP服务,提示词里写清任务类型、URL、要的字段,比如"用search_engine或scrape_as_markdown工具采集并输出结构化数据",AI就会自己调工具干活。
这个MCP跑在Web Unlocker上,每次请求自动处理代理轮换、反爬、验证码,新账号每月有5000次免费请求。实际场景很多:查资料时让它搜Google整理结果;做市场调研,跟它说"看看美国亚马逊手机类目卖得最好的前十名",返回的是商品名、价格这类结构化数据;做跨境电商采集器,抓完用pandas清洗,再让模型总结字段出分析报告,整个流程代码量很少。
路子二:CLI,写进脚本里更灵活
npm install -g @brightdata/cli(需要Node 20以上),brightdata login 登录后会自动建好代理区域,之后直接用。常用命令就几个:brightdata scrape 出干净markdown;brightdata search "关键词" --json 出结构化搜索结果;brightdata pipelines amazon_product "URL" --format csv 直接把亚马逊商品转CSV,pipelines支持电商、领英、社媒等40多个平台。在Cursor里可以让AI把这些命令写进你的Python脚本,组合成定时任务。
管道玩法也不错,比如先搜再抓:
brightdata search "best python frameworks 2025" --json | jq -r '.organic[0].link' | xargs brightdata scrape
大任务用 --async 提交,回头 brightdata status 查进度,不阻塞。
路子三:skill,让AI更会用这些工具
brightdata skill add 可以把search、scrape、data-feeds等技能包装进Cursor,教AI在合适时机调用对应能力,还能勾选装到哪些Agent。配置好后,AI对工具的理解比裸MCP更准,出错的次数明显少。
几个实际场景串起来:电商选品(pipelines拉商品和评论)、竞品监测(定时scrape目标页面存进数据库)、行业调研(search加scrape组合,AI自己汇总)、社媒分析(Instagram、YouTube评论结构化提取)。碰到网站改版字段抓不到,brightdata scraper heal 一句话让采集器自己修。
整体感受是,Cursor负责思考和编排,亮数据负责把网上的数据搬进来,两边各干各的活,效率比纯手写脚本高不少。