网络爬虫

网络爬虫验证码识别

借助一款本地识别工具,让爬虫顺畅通过 reCAPTCHA、Cloudflare Turnstile 和图片挑战——无论你抓取多少页面,都只需支付统一价格。

  • 无限量识别
  • 无限线程
  • 90–100% 准确率
  • 本地运行

验证码是爬虫停摆的最常见原因。爬虫顺畅运行数小时后,突然遇到 reCAPTCHA 插页或 Cloudflare Turnstile 挑战,此后的每个响应都返回空白。CapSkip 是一款面向网络爬虫的验证码识别工具,在你自己的 Windows 机器或 VPS 上本地运行,几秒内就把 token 交还给你的爬虫,让抓取持续进行,而不是卡在挑战后面排队。

抓取正是按次计费最痛的地方。2Captcha、Anti-Captcha、CapSolver 等服务按每千次识别计费,因此抓取成本随规模上升,大型任务在验证码上的花费甚至可能超过代理。CapSkip 采用统一定价:每月低至 10 美元的订阅,加上一次性 99 美元的终身授权,即可无限量识别、无限线程。你可以扩大并发而不增加账单,重试风暴也不产生任何额外费用。

它适配你现有的任何抓取技术栈。可从 Scrapy、requests、Selenium、Playwright 或 Puppeteer 中调用 Python、Node.js、PHP 或 .NET SDK,在有界面运行时加载浏览器扩展,或将现有的 2Captcha 和 Anti-Captcha 客户端代码指向 CapSkip 的本地 API 模拟,从而保留你现有的代码。由于识别在本地完成,你的目标 URL、site key 和页面图片永远不会交给第三方集群——当抓取目标关乎业务时,这一点至关重要。

无需编写代码。 运行 CapSkip 应用, 浏览器扩展 自动连接,然后直接在页面中识别验证码。已经在使用其他服务?迁移非常简单:CapSkip 是一个即插即用的 验证码识别工具 会自动连接,然后直接在页面上识别验证码。已在使用其他服务?迁移很简单:CapSkip 模拟 2Captcha、RuCaptcha、Anti-Captcha、CapMonster Cloud、CapSolver、DeathByCaptcha、SolveCaptcha 和 Captchas.io。在 CapSkip 应用的 hosts 文件中添加你的服务,你现有的代码即被路由到 CapSkip 并在本地识别,无需任何改动。

为什么 CapSkip 是最适合网络爬虫的验证码识别工具

无限量识别,统一价格

一个统一价格:一次性 99 美元终身授权,加上每月低至 10 美元的低价订阅。无需充值点数、无按次计费、无限流。

快速、高并发识别

图片验证码约 0.1 秒完成,reCAPTCHA、Turnstile 和极验通常在几秒内识别,且支持无限线程。

90–100% 准确率

在真实、实时的挑战上具有高成功率,并且每当出现新的验证码类型时都提供免费模型训练。

本地且私密

CapSkip 在你自己的机器或 VPS 上识别。挑战数据永远不会外发到第三方人工识别集群。

API 模拟

本地 HTTP API,可模拟 2Captcha、Anti-Captcha、CapSolver 等。将你的代码指向 CapSkip,其余保持不变。

扩展 + SDK

面向 Chrome 和 Firefox 的免代码浏览器扩展,以及用于自动化的官方 Python、Node.js、PHP 和 C# SDK。

在爬虫中识别验证码的三种方式

Python
# pip install capskip
from capskip import CapSkip
import requests

solver = CapSkip(host="127.0.0.1", port=8080)
session = requests.Session()

# The search results are behind a reCAPTCHA, so solve it first.
token = solver.recaptcha(
    sitekey="YOUR_SITEKEY",
    url="https://example.com/search",
)["code"]

page = session.post(
    "https://example.com/search",
    data={"q": "widgets", "g-recaptcha-response": token},
)

print(page.status_code, len(page.text))

识别挑战、提交 token,继续抓取。无限量识别、无限线程、统一价格。

免代码浏览器扩展

安装 CapSkip 扩展,它会在任意页面上检测小组件并为你识别,无需编写任何脚本。

官方 SDK

使用 Python、Node.js、PHP 和 C# 客户端,从你自己的代码中自动识别。几行代码即可返回有效 token。

本地 HTTP API

更喜欢原生 HTTP?CapSkip 提供一个本地端点,支持 2Captcha 和 Anti-Captcha API 模拟,任何 HTTP 客户端都可使用。

在真实挑战上看它运作

我们为每种验证码类型托管了实时、可交互的演示页面。加载真实小组件、运行 CapSkip,看着 token 返回。

抓取时如何识别验证码

  1. 1

    安装 CapSkip

    下载桌面应用 (Windows 版,或在 VPS 上运行)并启动它。本地识别引擎会自动启动。

  2. 2

    登录应用

    购买 1 美元试用青铜 / 白银 / 黄金授权 ,登录信息会立即通过邮件发送给你,付款后授权即刻生效。用它登录应用,你就可以开始识别了。 设置指南 有详细说明。

  3. 3

    自动识别

    使用 浏览器扩展 进行免代码识别,或从你的自动化中调用 SDK / HTTP API

CapSkip 与按次计费识别 API 的对比

功能CapSkip按次计费 API
大型抓取的成本固定月费,无限量识别每出现一个挑战页面就上涨
并发无限线程,可自由扩展工作进程并行进程越多,余额消耗越快
识别在哪里运行在你自己的抓取主机或 VPS 上远程服务器,每个挑战都多一次跳转
每个挑战的延迟图片验证码约 0.1 秒,token 类型几秒网络往返,外加共享队列中的等待时间
服务商能看到什么什么都看不到:目标 URL 和页面数据都留在你的机器上目标 URL、site key 和图片被发送到外部
爬虫集成Python、Node.js、PHP 和 .NET SDK,以及即插即用的 API 模拟每个服务都需一个专用客户端
重试与失败想重试多少次都行,不产生额外费用每次重试都是一次计费识别

授权简单,无限量识别

一次性购买终身授权,再按月低价订阅。每个方案都解锁无限量识别 每一种验证码类型,且永远无按次验证码费用。

青铜

99 美元一次性,然后

$10 /月

无限量识别

单设备授权(1 台)

单台机器上的无限量高速识别与无限线程。

立即订阅

黄金

99 美元一次性,然后

$20 /月

无限量识别

三设备授权(3 台)

最大规模:三台机器上的无限量识别与无限线程。

立即订阅

想先试用一下?

以 1 美元开始 7 天试用,在你自己的目标上识别 1,000 个任意类型的验证码。

开始 1 美元试用

每个付费授权均包含

  • 无限量高速识别,无按次验证码费用
  • 面向高并发自动化的无限线程
  • 识别 reCAPTCHA、Turnstile、极验和图片验证码
  • 90%–100% 的识别准确率
  • 模拟 2Captcha、Anti-Captcha、CapSolver 等
  • 无需编写代码,并提供对开发者友好的 API
  • 内置面向 Chrome 和 Firefox 的浏览器扩展
  • 即时激活授权,并免费训练新的验证码类型

不确定哪个档位合适?在 价格页面 进行比较,或阅读 常见问题.

网络爬虫中如何应对验证码

爬虫会遇到两类验证码:像 reCAPTCHA 和 Cloudflare Turnstile 这样的 token 挑战,需要一个有效的响应 token 随请求提交;以及图片挑战,需要读出其中的字符。CapSkip 两者都覆盖。对于 token 类型,将页面 URL 和 site key 传给 SDK,并把它返回的 token 注入到你的表单提交或自动化控制的浏览器页面中。对于图片类型,传入图片即可得到文字。将 CapSkip 运行在与爬虫相同的机器上(或爬虫所在的 VPS 上),使识别不增加网络跳转,并使用无限线程同时为多个工作进程识别。如果你的流程已经在调用 2Captcha 或 Anti-Captcha,保留那段代码,改为指向 CapSkip 的本地 API 模拟即可。不过,验证码识别工具并不能替代良好的抓取习惯:合理的速率限制、真实的请求头和优质的代理,仍然决定着挑战出现的频率。

常见问题

网络爬虫时我该如何应对验证码?
检测挑战、识别它,然后带着结果继续请求。使用 CapSkip 时,对于 reCAPTCHA 或 Turnstile,你传入页面 URL 和 site key,并将返回的 token 随表单数据提交;对于图片验证码,传入图片即可得到文字。识别在本地运行,因此不会给抓取增加任何网络往返。
最适合网络爬虫的验证码识别工具是哪个?
专就抓取而言,决定性因素通常是高并发下的成本。CapSkip 采用统一定价,无限量识别、无限线程,因此一次遇到一万个挑战的抓取与只遇到十个的成本相同,而且你可以扩展工作进程而不增加账单。
CapSkip 适用于 Scrapy、Selenium 和 Playwright 吗?
适用。这些 SDK 都是普通客户端,你可以从 Scrapy 中间件、requests 会话,或 Selenium、Playwright、Puppeteer 脚本中调用它们。对于有界面的浏览器运行,你还可以加载 CapSkip 扩展,让它自动识别页面中的小组件。
大型抓取的验证码识别成本是多少?
使用 CapSkip 时它是固定的:青铜每月 10 美元、白银 15 美元、黄金 20 美元,另加一次性 99 美元终身授权,全部无限量。按次计费的服务按每千个挑战收费,因此同一次抓取规模越大越贵。
CapSkip 能让我的爬虫通过 Cloudflare Turnstile 吗?
可以。CapSkip 既能识别 Turnstile 小组件,也能识别完整的 Turnstile 挑战页面,同时支持 reCAPTCHA v2、v3 及 Enterprise、极验 v3 以及数千种图片验证码类型。
识别验证码会拖慢我的爬虫吗?
远比远程服务慢得少。图片验证码约 0.1 秒返回,token 类型几秒返回;而且由于 CapSkip 运行在同一台机器上,路径中没有 API 往返或共享队列。
如果使用验证码识别工具,我还需要代理吗?
通常仍然需要,因为它们解决的是不同的问题。代理和合理的请求节奏能减少你被挑战的频率;CapSkip 则负责处理仍然出现的挑战。两者配合得很好,而且由于 CapSkip 无限量,当代理池触发了超出预期的挑战时,也不会因此惩罚你。
将验证码识别工具用于抓取合法吗?
CapSkip 是用于自动化你自己的工作流程、测试和数据采集的工具;你有责任遵守你所交互网站的条款以及适用的法律。CapSkip 不会为你作出该判断。

准备好让你的爬虫持续运行了吗?

下载 CapSkip、激活授权,即可从浏览器或代码中无限量识别验证码。统一价格,无按次计费。