反爬必修课之----(3)极验滑动验证码识别

       验证码识别成为了对抗反爬虫的必修课之一,看了崔庆才著的《python3网络爬虫开发实战》后受益匪浅,本专题将着重学习记录不同的验证码识别方式:图像验证码、宫格验证码、极验滑动验证码、点触验证码。


       [2019.3.6更新] 测试了下发现以下的版本识别率比较低,稍微改动了下代码。
       放到了GitHub


极验滑动验证码识别

先看看效果:

  • 识别思路:

  1. 模拟点击切换为滑动验证、并显示验证界面。
  2. 识别滑动缺口的位置,计算位移
  3. 模拟拖动滑块
  4. 若认证失败,重复调用

详细过程及代码如下:

  • 初始化

from selenium.webdriver.support import expected_conditions as EC    
from selenium import webdriver
from selenium.webdriver.support.wait import WebDriverWait
from selenium.webdriver.common.by import By
from selenium.webdriver import ActionChains
from PIL import Image
from io import BytesIO
import time

BORDER = 6

class CrackGeetest():
    def __init__(self):
        self.url = 'https://www.geetest.com/type/'
        self.browser = webdriver.Chrome()
        self.wait = WebDriverWait(self.browser,10)

    def open(self):
        '''
        打开网页
        :return None 
        '''
        self.browser.get(self.url)

    def close(self):
        '''
        关闭网页
        :return None
        '''
        self.browser.close()
        self.browser.quit()

       定义了一个 CrackGeetest 类,初始化selenium对象和一些参数配置,网址是极验的验证码测试页面。

  • 模拟点击

       首先模拟点击切换为滑动验证,然后模拟点击弹出验证图片。

    def change_to_slide(self):
        '''
        切换为滑动认证
        :return 滑动选项对象
        '''
        huadong = self.wait.until(
            EC.element_to_be_clickable((By.CSS_SELECTOR,'.products-content ul > li:nth-child(2)'))
        )
        return huadong

    def get_geetest_button(self):
        '''
        获取初始认证按钮
        :return 按钮对象
        '''
        button = self.wait.until(
            EC.element_to_be_clickable((By.CSS_SELECTOR,'.geetest_radar_tip'))
        )
        return button

       该步骤定义了两个方法,均利用显示等待的方法实现。并返回按钮对象,后用click()方法模拟点击。
效果如下:

  • 获取背景图

       首先等待验证码加载完成(wait_pic),获取网页截图(get_screenshot),然后获取验证背景图所在的位置及大小参数(get_position)和滑块对象(get_slider)。

    def wait_pic(self):
        '''
        等待验证图片加载完成
        :return None
        '''
        self.wait.until(
            EC.presence_of_element_located((By.CSS_SELECTOR,'.geetest_popup_wrap'))
        ) 

    def get_screenshot(self):
        """
        获取网页截图
        :return: 截图对象
        """
        screenshot = self.browser.get_screenshot_as_png()
        screenshot = Image.open(BytesIO(screenshot))
        return screenshot

    def get_position(self):
        '''
        获取验证码位置
        :return: 位置元组
        '''
        img = self.wait.until(EC.presence_of_element_located((By.CLASS_NAME,'geetest_canvas_img')))
        time.sleep(2)
        location = img.location
        size = img.size
        top, bottom = location['y'], location['y'] + size['height']
        left, right = location['x'], location['x'] + size['width'] 
        return (top, bottom, left, right) 

    def get_slider(self):
        '''
        获取滑块
        :return: 滑块对象
        '''
        slider = self.wait.until(EC.element_to_be_clickable((By.CLASS_NAME,'geetest_slider_button')))
        return slider

       再通过上述返回的背景图位置和大小参数,对网页截图进行切片(get_geetest_image),最后获取背景图。

    def get_geetest_image(self,name='captcha.png'):
        '''
        获取验证码图片
        :return: 图片对象
        '''      
        top, bottom, left, right = self.get_position()
        print('验证码位置',top, bottom, left, right)
        screenshot = self.get_screenshot()
        captcha = screenshot.crop((left, top, right, bottom))
        captcha.save(name)
        return captcha

       到这里,已经获取了带缺口的背景图,那怎么样才可以获取不带缺口滑块的原图呢?

       网上提供的方法中,我筛选出了两种实测可行的方法,一种是通过改变CSS样式获得原图,另一种是将源码返回的乱序图还原,这里着重介绍第一种,另一种在日后的文章中将补充。

       在《python3网络爬虫开发实战》中,由于写书的时间距今有一段时间,所以极验的验证码也存在更新,截至到今天(2018-11-30)无法直接先获取无缺口的原图,在通过点击获得带缺口背景图了。观察一下验证码页面的源代码,可以发现:


       将该canvas标签的style删除之后,滑块和阴影果然不见了,这样我们只需要通过js操作css样式属性,便可以继续分析了。这里用到了execute_script()方法,基本上Selenium API没有提供的功能都可以通过它执行JavaScript的方式来实现。不得不说这个功能还是挺好用的,可以类比Splash执行Lua脚本。
       执行js脚本之后(delete_style)获得了无缺口的原图,再调用之前的截图方法,就可以获取同大小的背景图了。

    def delete_style(self):
        '''
        执行js脚本,获取无滑块图
        :return None
        '''
        js = 'document.querySelectorAll("canvas")[2].style=""'
        self.browser.execute_script(js)

不带缺口的背景图

带缺口和阴影的背景图
  • 识别缺口

       我们得到了两张图,接下来就要对比他们来获取缺口位置。
       遍历图片的每个坐标点,获取两张图片的RGB数据,若差距在一定范围内,则认为两个像素相同,继续往下比对。若超过一定范围,则代表像素点不同,当且位置即为缺口位置。       is_pixel_equal()中定义了一个阈值范围threshold,为60,原因是缺口图中不仅有缺口部分的像素不同,其中还设置了一个干扰阴影块,和缺口大小类似,所以我们需要将范围适当提高。

    def is_pixel_equal(self, img1, img2, x, y):
        '''
        判断两个像素是否相同
        :param img1: 不带缺口图片
        :param img2: 带缺口图
        :param x: 位置x
        :param y: 位置y
        :return: 像素是否相同
        '''
        # 取两个图片的像素点
        pix1 = img1.load()[x, y]
        pix2 = img2.load()[x, y]
        threshold = 60
        if abs(pix1[0] - pix2[0]) < threshold \
        and abs(pix1[1] - pix2[1]) < threshold \
        and abs(pix1[2] - pix2[2]) < threshold:
            return True
        else:
            return False

       get_gap()方法遍历两张图片的每个像素,再利用is_pixel_equal()方法判断两张图片同一位置的像素。get_gap()中,left为起始横坐标,即是从滑块的右边开始寻找缺口位置。

    def get_gap(self, img1, img2):
        '''
        获取缺口偏移量
        :param img1: 不带缺口图片
        :param img2: 带缺口图
        :return 缺口位置
        '''
        left = 60 
        for i in range(left, img1.size[0]):
            for j in range(img1.size[1]):
                if not self.is_pixel_equal(img1, img2, i, j):
                    left = i
                    return left
        return left

  • 模拟拖动。

       上面我们获得了滑块的位置,现在只需要计算距离并且模拟拖动即可。
       不难想到,将滑块匀速运动或者直接闪到缺口位置是肯定不行的,我们要尽量模拟人手拖动鼠标的情况。所以我在崔大给的方案的基础上做了一点改进。

大致过程:
       首先加速拖动滑块,当快接近缺口时,开始减速拖动,超过缺口一点距离后再往回拖拽对齐,由于人手可能不能对得非常整齐,所以我设置了1到2个像素的误差,并且再最后加入了3个像素距离的左右滑动来模拟释放鼠标时的抖动情况。

效果如下:

利用中学时期的物理公式,即可构造轨迹移动算法。
       x = v0*t + 1/2*a*t^2
       v = v0 + a*t

    def get_track(self, distance):
        '''
        根据偏移量获取移动轨迹
        :param distance: 偏移量
        :return: 移动轨迹
        '''
        #移动轨迹
        track = []
        #当前位移
        current = 0
        #减速阈值
        mid = distance * 3 / 5
        #计算间隔
        t = 0.2
        #初速度
        v = 0
        #滑超过过一段距离
        distance += 14
        while current < distance:
            if current < mid:
                #加速度为正
                a = 2
            else:
                #加速度为负
                a = -1.5
            #初速度 v0
            v0 = v
            #当前速度 v
            v = v0 + a * t
            #移动距离 move-->x
            move = v0 * t + 1 / 2 * a * t * t
            #当前位移
            current += move
            #加入轨迹
            track.append(round(move))
        return track

       前3/5路程加速,后面减速,track返回的是一个列表,其中每个元素代表的是每次移动的距离。然后模拟释放鼠标时的人手抖动(shake_mouse)。
       最后根据之前所得到的运动轨迹拖动滑块(move_to_gap)即可。

    def shake_mouse(self):
        '''
        模拟人手释放鼠标时的抖动
        :return: None
        '''
        ActionChains(self.browser).move_by_offset(xoffset=-3, yoffset=0).perform()
        ActionChains(self.browser).move_by_offset(xoffset=2, yoffset=0).perform()

    def move_to_gap(self, slider, tracks):
        '''
        拖动滑块到缺口处
        :param slider: 滑块
        :param tracks: 轨迹
        :return
        '''
        back_tracks = [-1, -1, -2, -2, -3, -2, -2, -1, -1]
        ActionChains(self.browser).click_and_hold(slider).perform()
        #正向
        for x in tracks:
            ActionChains(self.browser).move_by_offset(xoffset=x, yoffset=0).perform()
        #逆向
        for x in back_tracks:
            ActionChains(self.browser).move_by_offset(xoffset=x, yoffset=0).perform()
        #模拟抖动
        self.shake_mouse()
        time.sleep(0.5)
        ActionChains(self.browser).release().perform()

其整个控制流程,如下:
       执行主体流程,若验证失败, 则再次调用crack()进行识别,直至成功。

    def crack(self):
        try:
            #打开网页
            self.open()
            #转换验证方式,点击认证按钮
            s_button = self.change_to_slide()
            s_button.click()
            g_button = self.get_geetest_button()
            g_button.click()
            #确认图片加载完成
            self.wait_pic()
            #获取滑块
            slider = self.get_slider()
            #获取带缺口的验证码图片
            image1 = self.get_geetest_image('captcha1.png')
            self.delete_style()
            image2 = self.get_geetest_image('captcha2.png')
            gap = self.get_gap(image1,image2)
            print('缺口位置',gap)
            gap -= BORDER
            track = self.get_track(gap)
            self.move_to_gap(slider, track)
            success =  self.wait.until(
                EC.text_to_be_present_in_element((By.CLASS_NAME,'geetest_success_radar_tip_content'),'验证成功')
            )
            print(success)
            time.sleep(5)
            self.close()
        except:
            print('Failed-Retry')
            self.crack()


    
if __name__ == '__main__':
    crack = CrackGeetest()
    crack.crack()

       至此,极验滑动验证码识别——网页截图对比方法已经记录完毕。


  • 关键字总结

  1. webdriver():
           support.expected_conditions as EC
           support.wait.WebDriverWait
           ActionChains
           common.by.By
  2. BytesIO
  3. 代码风格
  4. 验证码分析思路
最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
  • 序言:七十年代末,一起剥皮案震惊了整个滨河市,随后出现的几起案子,更是在滨河造成了极大的恐慌,老刑警刘岩,带你破解...
    沈念sama阅读 158,847评论 4 362
  • 序言:滨河连续发生了三起死亡事件,死亡现场离奇诡异,居然都是意外死亡,警方通过查阅死者的电脑和手机,发现死者居然都...
    沈念sama阅读 67,208评论 1 292
  • 文/潘晓璐 我一进店门,熙熙楼的掌柜王于贵愁眉苦脸地迎上来,“玉大人,你说我怎么就摊上这事。” “怎么了?”我有些...
    开封第一讲书人阅读 108,587评论 0 243
  • 文/不坏的土叔 我叫张陵,是天一观的道长。 经常有香客问我,道长,这世上最难降的妖魔是什么? 我笑而不...
    开封第一讲书人阅读 43,942评论 0 205
  • 正文 为了忘掉前任,我火速办了婚礼,结果婚礼上,老公的妹妹穿的比我还像新娘。我一直安慰自己,他们只是感情好,可当我...
    茶点故事阅读 52,332评论 3 287
  • 文/花漫 我一把揭开白布。 她就那样静静地躺着,像睡着了一般。 火红的嫁衣衬着肌肤如雪。 梳的纹丝不乱的头发上,一...
    开封第一讲书人阅读 40,587评论 1 218
  • 那天,我揣着相机与录音,去河边找鬼。 笑死,一个胖子当着我的面吹牛,可吹牛的内容都是我干的。 我是一名探鬼主播,决...
    沈念sama阅读 31,853评论 2 312
  • 文/苍兰香墨 我猛地睁开眼,长吁一口气:“原来是场噩梦啊……” “哼!你这毒妇竟也来了?” 一声冷哼从身侧响起,我...
    开封第一讲书人阅读 30,568评论 0 198
  • 序言:老挝万荣一对情侣失踪,失踪者是张志新(化名)和其女友刘颖,没想到半个月后,有当地人在树林里发现了一具尸体,经...
    沈念sama阅读 34,273评论 1 242
  • 正文 独居荒郊野岭守林人离奇死亡,尸身上长有42处带血的脓包…… 初始之章·张勋 以下内容为张勋视角 年9月15日...
    茶点故事阅读 30,542评论 2 246
  • 正文 我和宋清朗相恋三年,在试婚纱的时候发现自己被绿了。 大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
    茶点故事阅读 32,033评论 1 260
  • 序言:一个原本活蹦乱跳的男人离奇死亡,死状恐怖,灵堂内的尸体忽然破棺而出,到底是诈尸还是另有隐情,我是刑警宁泽,带...
    沈念sama阅读 28,373评论 2 253
  • 正文 年R本政府宣布,位于F岛的核电站,受9级特大地震影响,放射性物质发生泄漏。R本人自食恶果不足惜,却给世界环境...
    茶点故事阅读 33,031评论 3 236
  • 文/蒙蒙 一、第九天 我趴在偏房一处隐蔽的房顶上张望。 院中可真热闹,春花似锦、人声如沸。这庄子的主人今日做“春日...
    开封第一讲书人阅读 26,073评论 0 8
  • 文/苍兰香墨 我抬头看了看天上的太阳。三九已至,却和暖如春,着一层夹袄步出监牢的瞬间,已是汗流浃背。 一阵脚步声响...
    开封第一讲书人阅读 26,830评论 0 195
  • 我被黑心中介骗来泰国打工, 没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留,地道东北人。 一个月前我还...
    沈念sama阅读 35,628评论 2 274
  • 正文 我出身青楼,却偏偏与公主长得像,于是被迫代替她去往敌国和亲。 传闻我的和亲对象是个残疾皇子,可洞房花烛夜当晚...
    茶点故事阅读 35,537评论 2 269

推荐阅读更多精彩内容

  • 1.滑动验证码 前面介绍了利用 tesserocr 来识别简单的图形验证码,和利用openCV识别滑动验证码的缺口...
    浩成聊技术阅读 22,479评论 6 15
  • 2017-08-30,二两 诗人,总善于 把自己 归于特立独行的一类 并且 自觉不自觉的 暗示和强化 甚至动用传媒...
    闫安阅读 229评论 0 0
  • 旧的一年过去,新的一年又已经来到了我们的身边,带着对我们的祝福和期盼,带着我们新的气象和气息。 岁岁年年,年年岁岁...
    阿俊xi阅读 190评论 0 0
  • 不知什么风 把你捧上一片如絮的白云 席云而坐 羽扇纶巾 上看浩瀚长空 下瞧众生芸芸 自鸣得意 声若洪钟 我是诗...
    小小佘阅读 219评论 0 1
  • 著名小说家R·到山里去进行了一次为时三天的郊游之后,这天清晨返回维也纳,在火车站买了一份报纸。他看了一眼日期,突然...
    一只大柚子阅读 341评论 2 1