跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客我的书AI学习GitHub 精选镜像AI 生图工具UI配色美学关于
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
PythonSaaS算法

Web Unlocker API 获取亚马逊平台数据示例

Web Unlocker API 结合 Python 脚本可绕过亚马逊反爬机制获取商品数据。方案包含配置代理基础设施、编写请求代码及解析 HTML 结果。通过自动化处理验证码和指纹,实现高效数据采集并导出为 CSV 格式。

王初壹发布于 2026/4/6更新于 2026/9/1267 浏览
Web Unlocker API 获取亚马逊平台数据示例

一、Web Unlocker API 简介

Web Unlocker 使用代理基础设施,具有三个主要组件:请求管理、浏览器指纹伪装和内容验证。这使得它能自动管理所有网站解锁操作,包括 CAPTCHA 验证、浏览器指纹识别、自动重试、选择合适的请求头和 cookies 等。当您需要获取高防网站数据时,这些功能尤为重要。

与常规代理服务不同,Web Unlocker API 只需发送一个包含目标网站的 API 请求,系统就会返回干净的 HTML/JSON 响应。在后台,它的智能算法无缝管理寻找最佳代理网络、定制请求头、指纹处理和 CAPTCHA 验证等动态过程。

二、开始使用 Web Unlocker API

Web Unlocker API 可以以前所未有的成功率自动解锁防范最严密的网站。它的自动化周期管理,并且不需要任何的编码和爬虫经验即可使用。

1、首先进入控制台页面

点击左侧第一个 tab 键'代理 & 抓取基础设施',找到'网页解锁器',开始使用。

2、进入网页解锁器页面后

填写通道名称,添加简短描述,点击添加。

3、直接展示代理基础设施信息

包含 Web Unlocker API 的详细信息、配置信息、代码示例。

4、配置网页解锁器

针对最难的网站进行自动化抓取,利用动态住宅 IP,解决 CAPTCHA,渲染 JS,使用自定义指纹和 cookies。

5、以 Python 脚本获取亚马逊平台数据为示例

(1)定位具体数据

进入亚马逊平台后,搜索关键词,复制网页地址链接。该页面给出了很多相关产品,定位具体数据,比如电脑、固态硬盘等,还包含了产品信息、价格等。

(2)编写 Python 代码

代码中需要修改为已配置好的 Web Unlocker 详细信息,比如主机、端口、用户名、密码等信息。

import requests
from bs4 import BeautifulSoup
import pandas as pd
import warnings

# 忽略 SSL 警告
warnings.filterwarnings('ignore', message='Unverified HTTPS request')

# 您的 Bright Data 凭证(请替换为您的实际凭证)
customer_id = "YOUR_CUSTOMER_ID"
zone_name = "web_unlocker3"
zone_password = "YOUR_PASSWORD"

# 代理设置
proxy_url = "brd.superproxy.io:33335"
proxy_auth = f"brd-customer-{customer_id}-zone-{zone_name}:{zone_password}"
proxies = {
    "http": f"http://{proxy_auth}@{proxy_url}",
    "https": f"http://{proxy_auth}@{proxy_url}"
}

# 目标亚马逊搜索 URL
target_url = "https://www.amazon.com/s?k=gaming&language=zh&_encoding=UTF8"

# 添加适当的请求头,模拟真实浏览器
headers = {
    "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/91.0.4472.124 Safari/537.36",
    "Accept-Language": "zh-CN,zh;q=0.9,en;q=0.8",
    "Accept": "text/html,application/xhtml+xml,application/xml;q=0.9,image/webp,*/*;q=0.8",
    "Accept-Encoding": "gzip, deflate, br",
    "Referer": "https://www.amazon.com/"
}

try:
    print("正在通过代理发送请求...")
    response = requests.get(
        target_url,
        proxies=proxies,
        headers=headers,
        verify=False  # 禁用 SSL 验证
    )
    print(f"请求状态码:{response.status_code}")

    # 保存 HTML 响应
    with open("amazon_gaming_search.html", "w", encoding="utf-8") as file:
        file.write(response.text)
    print("成功获取亚马逊搜索数据,已保存到 amazon_gaming_search.html")

    # 解析搜索结果
    soup = BeautifulSoup(response.text, "html.parser")
    search_results = []

    # 针对亚马逊搜索结果页面的选择器
    product_cards = soup.select(".s-result-item[data-asin]:not([data-asin=''])")
    print(f"找到 {len(product_cards)} 个产品")

    for card in product_cards:
        asin = card.get("data-asin")
        try:
            title_element = card.select_one("h2 a span")
            title = title_element.text.strip() if title_element else "N/A"
            price_element = card.select_one(".a-price .a-offscreen")
            price = price_element.text.strip() if price_element else "N/A"
            rating_element = card.select_one(".a-icon-star-small")
            rating = rating_element.text.strip() if rating_element else "N/A"
            reviews_element = card.select_one("span.a-size-base.s-underline-text")
            reviews = reviews_element.text.strip() if reviews_element else "N/A"

            search_results.append({
                "asin": asin,
                "title": title,
                "price": price,
                "rating": rating,
                "reviews": reviews,
                "url": f"https://www.amazon.com/dp/{asin}"
            })
            print(f"已解析:{title[:30]}...")
        except Exception as e:
            print(f"解析产品 {asin} 时出错:{str(e)}")

    # 保存结果到 CSV
    if search_results:
        df = pd.DataFrame(search_results)
        df.to_csv("amazon_gaming_search_results.csv", index=False, encoding="utf-8-sig")
        print(f"已成功抓取 {len(search_results)} 个搜索结果,保存到 amazon_gaming_search_results.csv")

        # 显示前 5 条数据
        print("\n搜索结果前 5 条数据:")
        print(df.head().to_string())
    else:
        print("未找到搜索结果")
except Exception as e:
    print(f"请求失败:{str(e)}")

6、结果示例

成功运行后,代码会下载亚马逊游戏类别的搜索页面 HTML,将原始 HTML 保存到文件,解析出产品信息(ASIN、标题、价格、评分、评论数等),将解析结果保存到 CSV 文件。

三、Web Scraper

1、快速使用 Web Scraper

Web Scraper 提供了最大的灵活性,无需维护代理和解封基础设施,让用户能够轻松地从任何地理位置抓取数据,同时避开验证码和网站封锁。Web Scraper 作为一种专为网页抓取设计的 GUI 浏览器,内置了网站解锁功能,可自动处理封锁问题。

Bright Data 的 Web Scraper 是一种云服务,能够自动处理 IP 轮换、验证码解决和数据解析,将数据转换为结构化格式。对于亚马逊数据,能够提取标题、卖家名称、品牌、描述、价格、货币、可用性和评论数量等信息。这种结构化的数据输出使得分析和集成变得简单直接,支持 JSON、NDJSON 和 CSV 等多种数据格式。

2、通过 python 获取亚马逊网页数据

# 获取商品信息
product_elements = driver.find_elements(By.CSS_SELECTOR, ".s-main-slot .s-result-item")

# 创建 CSV 文件并写入数据
with open('amazon_products.csv', 'w', newline='', encoding='gbk') as csvfile:
    fieldnames = ['Title', 'Price', 'Image URL']
    writer = csv.DictWriter(csvfile, fieldnames=fieldnames)
    writer.writeheader()
    for index, product in enumerate(product_elements):
        try:
            title = product.find_element(By.CSS_SELECTOR, ".a-text-normal").text
            price = product.find_element(By.CSS_SELECTOR, ".a-price-whole").text
            image_url = product.find_element(By.CSS_SELECTOR, "img.s-image").get_attribute("src")
            print(f"Product {index + 1}:")
            print(f"Title: {title}")
            print(f"Price: {price} USD")
            print(f"Image URL: {image_url}")
            # 写入 CSV 文件
            writer.writerow({'Title': title, 'Price': price, 'Image URL': image_url})
        except Exception as e:
            print(f"Skipping product {index + 1} due to missing information.")
        time.sleep(2)

# 关闭浏览器
driver.quit()

3、定位具体数据

通过 CSS 选择器定位具体的商品元素。

4、运行并保存到 csv 文件

运行脚本并将结果保存至 CSV 文件。

四、SERP API

SERP API 是解锁抓取套件的一部分,其核心优势在于处理完整的代理、解锁和解析基础设施,让用户可以专注于从搜索引擎结果页 (SERPs) 收集数据。SERP API 通过模拟真实浏览器行为并提供完整的 JavaScript 支持来绕过搜索引擎的访问限制,实时提供准确的、结构化的搜索数据。

这种强大的自动化机制处理了 IP 轮换、验证码解决、浏览器指纹管理等复杂问题,使用户无需担心被搜索引擎封锁。

六、总结

提供的 Web Unlocker API、Web Scraper 及 SERP API 构成了一套完整的数据采集解决方案,可有效应对高防网站的反爬挑战。

Web Unlocker API 通过请求管理、浏览器指纹伪装和内容验证三大核心组件,实现了对 CAPTCHA 的自动解决、浏览器指纹的智能处理以及请求的自动优化。Web Scraper 则提供了更高级的灵活性和控制力,能将原始数据转化为结构化格式。SERP API 专注于搜索引擎结果页的数据获取,进一步拓展了数据采集的边界。

这些工具的核心价值在于让数据采集工作变得简单高效,使用户无需深厚的编程背景也能实现专业级的数据抓取。

目录

  1. 一、Web Unlocker API 简介
  2. 二、开始使用 Web Unlocker API
  3. 1、首先进入控制台页面
  4. 2、进入网页解锁器页面后
  5. 3、直接展示代理基础设施信息
  6. 4、配置网页解锁器
  7. 5、以 Python 脚本获取亚马逊平台数据为示例
  8. (1)定位具体数据
  9. (2)编写 Python 代码
  10. 忽略 SSL 警告
  11. 您的 Bright Data 凭证(请替换为您的实际凭证)
  12. 代理设置
  13. 目标亚马逊搜索 URL
  14. 添加适当的请求头,模拟真实浏览器
  15. 6、结果示例
  16. 三、Web Scraper
  17. 1、快速使用 Web Scraper
  18. 2、通过 python 获取亚马逊网页数据
  19. 获取商品信息
  20. 创建 CSV 文件并写入数据
  21. 关闭浏览器
  22. 3、定位具体数据
  23. 4、运行并保存到 csv 文件
  24. 四、SERP API
  25. 六、总结

更多推荐文章

查看全部
  • Java 全栈开发工程师面试技术问答:从基础到进阶
  • AI 创作者崛起:掌握核心工具与 AMA 互动成长
  • Dubbo 服务降级机制详解:Mock 配置与实战
  • SQL 高级查询技巧与预处理语句实战详解
  • AI Agent 中的 Skills 概念与作用
  • 2025 机器人元年:小鹏 IRON、宇树 H2、擎天柱与 1X-Neo 硬件构造对比分析
  • OpenClaw 集成飞书机器人配置指南
  • 基于 ThinkPHP 与 Uniapp 的防伪溯源系统搭建指南
  • Python 纪念币预约自动化工具配置指南
  • Python asyncio 异步编程教程
  • Spring Cloud Gateway 过滤器工厂详解
  • Python Wheel (.whl) 文件安装实战指南
  • MCP 协议详解:与 Function Call 的区别及 Python 实践
  • idea如何接入claude模型,枯燥乏味、复杂难搞的工作交给AI
  • LLaMA-Factory 环境配置与安装实战指南
  • Trae 编辑器 C++ 编译环境配置实战
  • 职场人士如何自学 Python:目标规划与学习路径
  • C++ 模板详解:非类型参数与特化
  • Whisper 语音识别本地化部署实战指南
  • GO与KEGG富集分析实战:从差异基因到功能注释

相关免费在线工具

  • 加密/解密文本

    使用加密算法(如AES、TripleDES、Rabbit或RC4)加密和解密文本明文。 在线工具,加密/解密文本在线工具,online

  • Gemini 图片去水印

    基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印,支持批量处理与下载。 在线工具,Gemini 图片去水印在线工具,online

  • curl 转代码

    解析常见 curl 参数并生成 fetch、axios、PHP curl 或 Python requests 示例代码。 在线工具,curl 转代码在线工具,online

  • Base64 字符串编码/解码

    将字符串编码和解码为其 Base64 格式表示形式即可。 在线工具,Base64 字符串编码/解码在线工具,online

  • Base64 文件转换器

    将字符串、文件或图像转换为其 Base64 表示形式。 在线工具,Base64 文件转换器在线工具,online

  • Markdown转HTML

    将 Markdown(GFM)转为 HTML 片段,浏览器内 marked 解析;与 HTML转Markdown 互为补充。 在线工具,Markdown转HTML在线工具,online