Shopee 商品数据高效抓取:请求与缓存校验 3 大核心

简介: 本文针对Shopee商品数据效率低、重复请求的痛点,提炼出经生产验证的3大核心方案:统一URL解析、精简关键请求头、ETag缓存校验,显著提升跨境选品、竞品分析与价格监控的稳定性与效率。

本文针对 Shopee 平台商品数据抓取中常见的反爬拦截、效率低下、重复请求三大痛点,总结了经过生产验证的 3 大核心要点。适用于跨境选品、竞品分析、价格监控等场景

一、URL 结构与 ID 快速提取

Shopee 全球所有站点采用完全统一的商品 URL 设计,无需针对不同地区单独适配解析逻辑,这是实现批量自动化抓取的基础。
1.全球通用 URL 格式
标准商品 URL 结构:

https://{
   地区代码}.shopee.com/product/{
   店铺ID}/{
   商品ID}

常见地区代码:tw (中国台湾)、sg (新加坡)、my (马来西亚)、th (泰国)、id (印尼)、ph (菲律宾)、vn (越南)
兼容性:支持带任意查询参数的 URL(如?spm=xxx&utm_source=yyy),不影响 ID 提取
示例:

import re

def get_shopee_ids(url: str) -> tuple[str | None, str | None]:
    """
    从Shopee商品URL中提取店铺ID和商品ID
    :param url: Shopee商品完整URL
    :return: (店铺ID, 商品ID),解析失败返回(None, None)
    """
    pattern = r'/product/(\d+)/(\d+)'
    match = re.search(pattern, url)
    return match.groups() if match else (None, None)

# 测试示例
if __name__ == "__main__":
    # http://o0b.cn/alan
    test_urls = [
        "https://shopee.tw/product/123456789/987654321",
        "https://shopee.sg/product/987654321/123456789?spm=a1z10.1-c-seller",
        "https://invalid-url.com/product/abc/123"
    ]

    for url in test_urls:
        shop_id, item_id = get_shopee_ids(url)
        print(f"URL: {url}")
        print(f"店铺ID: {
   shop_id}, 商品ID:

二、必带核心请求头

Shopee 的反爬系统对请求头校验极为严格,只需配置以下 5 个核心请求头,即可绕过 90% 以上的基础拦截,其余非必要头字段可全部省略,减少请求体积

基础商品页面请求示例

from curl_cffi import requests
import random
import time

session = requests.Session(
    headers={
   
        "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) "
                      "AppleWebKit/537.36 (KHTML, like Gecko) "
                      "Chrome/125.0.0.0 Safari/537.36",
        "Accept": "text/html,application/xhtml+xml,application/xml;q=0.9,*/*;q=0.8",
        "Accept-Language": "zh-TW,zh;q=0.9",
        "Referer": "https://shopee.tw/",
        "Cookie": "粘贴你浏览器里的完整 Cookie",
    },
    impersonate="chrome101",
)

# http://o0b.cn/alan
urls = [
    "https://shopee.tw/product/123456789/987654321",
    "https://shopee.tw/product/123456789/123456789",
]
for url in urls:
    r = session.get(url, timeout=10)
    print(url, r.status_code)
    time.sleep(random.uniform(1.2, 2.5))

三、ETag 缓存校验

Shopee 使用MD5 哈希值作为 ETag 实体标签,唯一标识商品页面的特定版本。通过缓存校验机制,可避免重复下载未变化的页面内容,对于价格、库存等更新频率较低的字段,能提升 90% 以上的抓取效率,同时大幅降低被平台的风险。

ETag 生成规则
若因特殊情况无法获取服务器返回的 ETag,可使用 Shopee 官方规则自行计算

import hashlib

def generate_etag(shop_id: str, item_id: str) -> str:
    """根据Shopee官方规则生成备用ETag"""
    raw = f"{shop_id}_{item_id}".encode("utf-8")
    return f'"{hashlib.md5(raw).hexdigest()}"'

带缓存的请求代码

from typing import Dict, Tuple
import requests
import hashlib

cache: Dict[str, Tuple[str, str]] = {
   }

def get_shopee_ids(url: str) -> Tuple[str, str]:
    parts = url.split('/')
    for i, part in enumerate(parts):
        if part == 'product' and i + 2 < len(parts):
            return parts[i+1], parts[i+2]
    return '', ''

def get_common_headers(region: str, cookie: str) -> dict:
    return {
   
        "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/125.0.0.0 Safari/537.36",
        "Cookie": cookie,
        "Referer": f"https://{region}.shopee.com/",
        "Accept-Encoding": "gzip, deflate, br",
        "Connection": "keep-alive",
        "Accept": "text/html,application/xhtml+xml,application/xml;q=0.9,*/*;q=0.8",
        "Accept-Language": "zh-TW,zh;q=0.9,en;q=0.8"
    }

def generate_etag(shop_id: str, item_id: str) -> str:
    return hashlib.md5(f"{shop_id}_{item_id}".encode()).hexdigest()

def fetch_shopee_with_cache(url: str, cookie: str) -> str:
    shop_id, item_id = get_shopee_ids(url)
    if not shop_id or not item_id:
        raise ValueError("无效的Shopee商品URL")
    cache_key = f"{shop_id}_{item_id}"
    region = url.split('.')[0].split('//')[-1]
    headers = get_common_headers(region, cookie)
    if cache_key in cache:
        cached_etag, cached_content = cache[cache_key]
        headers["If-None-Match"] = cached_etag
    response = requests.get(url, headers=headers, timeout=10)
    if response.status_code == 304:
        print(f"[缓存命中] {cache_key} 资源未变化,使用本地缓存")
        return cached_content
    elif response.status_code == 200:
        etag = response.headers.get("ETag", generate_etag(shop_id, item_id))
        content = response.text
        cache[cache_key] = (etag, content)
        print(f"[缓存更新] {cache_key} 资源已更新,缓存已刷新")
        return content
    else:
        response.raise_for_status()

if __name__ == "__main__":
    MY_COOKIE = "替换为你的Shopee Cookie(从浏览器复制完整Cookie字符串)"
    test_url = "https://shopee.tw/product/123456789/987654321"
    try:
        content1 = fetch_shopee_with_cache(test_url, MY_COOKIE)
        print(f"第一次请求内容长度: {len(content1)} 字符\n")
        content2 = fetch_shopee_with_cache(test_url, MY_COOKIE)
        print(f"第二次请求内容长度: {len(content2)} 字符\n")
        assert content1 == content2, "缓存内容与原始内容不一致"
        print("缓存校验成功,两次请求内容完全一致")
    except Exception as e:
        print(f"请求失败: {str(e)}")

四、避坑指南

Cookie 获取与更新:从浏览器开发者工具 Network 面板,任意 Shopee 页面请求的 Cookie 中复制SPC_EC和SPC_U字段,有效期通常为 1-2 周,过期后需重新获取

请求频率控制:建议单 IP 每秒请求不超过 1 次,批量抓取时添加random.uniform(0.5, 1.5)随机延迟,避免触发 IP 封禁

地区一致性:请求头中的 Referer 必须与 URL 中的地区代码完全一致,否则会被重定向或拦截

动态内容处理:商品实时价格、库存、销量等数据通过 AJAX 接口加载,需单独请求接口获取

异常处理:添加重试机制(使用tenacity库),针对 429(请求过多)、503(服务不可用)等错误进行指数退避重试

目录
相关文章
|
6月前
|
安全 JavaScript 前端开发
React2Shell 漏洞自动化凭证窃取攻击机理与防御研究
CVE-2025-55182(React2Shell)是CVSS 10.0的高危RCE漏洞,可无认证、无交互远程接管Next.js等RSC应用服务器。2026年已爆发规模化自动化凭证窃取攻击,单日入侵766台服务器。本文系统剖析漏洞机理与攻击链,构建检测、监控、防御、响应一体化闭环体系,提供可落地的代码与方案。(239字)
331 16
|
Java 应用服务中间件 微服务
【Java异常】feign.FeignException: status 400 reading xxx 异常解决方案
【Java异常】feign.FeignException: status 400 reading xxx 异常解决方案
637 0
|
4月前
|
人工智能 算法 安全
GEO优化:官网建设的重要性,如何铸就数字信任与增长引擎
生成式AI正推动SEO向GEO(生成式引擎优化)范式跃迁:核心目标从“抢排名”转向“成信源”。于磊首创“两大核心+四轮驱动”理论,确立官网为唯一信任锚点,以E-E-A-T具象化、结构化内容、意图关键词与精准引用,助企业构建AI时代数字竞争力。
314 3
|
5月前
|
JSON 安全 API
API数据格式认证方式框架及工具
本文详解API安全三大认证方式:轻量级API Key、无状态JWT令牌及金融级HMAC签名,配Python实战代码与最佳实践(如密钥管理、短期过期、防重放等),助开发者按场景选型,筑牢数据交互防线。(239字)
394 5
|
5月前
|
人工智能 运维 安全
Windows10用户部署OpenClaw的终极指南|路径规范+权限配置+故障排查
专为Windows 10 64位深度优化的OpenClaw(小龙虾)一键部署包:免命令行、免环境配置,解压即装;内置全部依赖与28万Tokens,全程可视化操作;独家解决SmartScreen拦截、权限限制等Win10特有问题,新手也能一次成功“养虾”!
|
6月前
|
编解码 缓存 API
【开源剪映小助手】草稿管理接口
本文档详解剪映草稿管理三大核心API:创建、保存及获取草稿文件列表,涵盖请求参数、响应格式、错误码、URL规则与最佳实践,助力开发者快速集成稳定高效的草稿系统。(239字)
|
4月前
|
人工智能 自然语言处理 测试技术
3 分钟搞定!阿里云 OpenClaw 官方镜像,六大场景开箱即用指南
阿里云官方推出的OpenClaw智能助理平台,基于通义千问大模型,提供六大核心场景支持:超级助理、内容创作、股票分析、一人团队、开发助手与海外运营。零代码3分钟快速部署,安全可靠、开箱即用,助力开发者降本增效、加速业务增长。
|
4月前
|
人工智能 自然语言处理 测试技术
【阿里云官方】六大核心场景用途:免环境配置!阿里云OpenClaw官方镜像一键安装教程 开箱即用
阿里云官方推出的OpenClaw智能助理平台,基于通义千问大模型,提供六大核心场景:超级助理、内容创作、股票分析、一人团队、开发助手和海外运营。零代码3分钟快速部署,安全可靠、开箱即用,助力开发者高效成长与业务增长。
|
4月前
|
人工智能 自然语言处理 测试技术
【阿里云官方】六大核心场景用途:OpenClaw 智能助理平台云端部署完整流程
阿里云官方推出的OpenClaw智能助理平台,基于通义千问大模型深度定制,覆盖超级助理、内容创作、股票分析、一人团队、开发助手、海外运营六大核心场景。支持零代码部署,3分钟即可搭建专属AI工作流,助力开发者、创作者与运营者提效降本、加速业务增长。(239字)
|
5月前
|
存储 监控 API
基于Python的API调用与智能选品逻辑代码示例
本示例展示电商选品自动化逻辑:基于淘宝/1688等平台API,实现关键词搜索、销量/价格/起订量筛选、毛利率计算及差评关键词分析,输出高潜力商品(销量≥1000、差评率<5%、毛利率≥30%),含防封禁调用控制与可扩展架构。
297 3