前言: 在爬虫过程中,我们可能需要重复的爬取同一个网站,为了避免重复的数据存入我们的数据库中 通过实现增量去重 去解决这一问题 本文还针对了那些需要实时更新的网站 增加了一个定时爬取的功能;
本文作者同开源中国(殊途同归_);
解决思路:
1.获取目标url
2.解析网页
3.存入数据库(增量去重)
4.异常处理
5.实时更新(定时爬取)
下面为数据库的配置 mysql_congif.py:
import pymysql def insert_db(db_table, issue, time_str, num_code): host = '127.0.0.1' user = 'root' password = 'root' port = 3306 db = 'lottery' data_base = pymysql.connect(host=host, user=user, password=password, port=port, db=db) cursor = data_base.cursor() try: sql = "INSERT INTO %s VALUES ('%s','%s','%s')" % (db_table, issue, time_str, num_code) cursor.execute(sql) data_base.commit() except ValueError as e: print(e) data_base.rollback() finally: cursor.close() data_base.close() def select_db(issue, db_table): host = '127.0.0.1' user = 'root' password = 'root' port = 3306 db = 'lottery' data_base = pymysql.connect(host=host, user=user, password=password, port=port, db=db) cursor = data_base.cursor() try: sql = "SELECT '%s' FROM %s " % (issue, db_table) cursor.execute(sql) data_base.commit() except ValueError as e: print(e) data_base.rollback() finally: return issue
接下来是主要代码 test.py:
# 使用bs4进行网页解析 # 实现了增量去重 # 实现了定时爬取 import datetime import time from bs4 import BeautifulSoup import requests from mysql_config import insert_db from mysql_config import select_db def my_test(): db_table = 'lottery_table' url = 'http://kj.13322.com/kl10_dkl10_history_dtoday.html' res = requests.get(url) content = res.content soup = BeautifulSoup(content, 'html.parser', from_encoding='utf8') c_t = soup.select('#trend_table')[0] trs = c_t.contents[4:] for tr in trs: if tr == '\n': continue tds = tr.select('td') issue = tds[1].text time_str = tds[0].text num_code = tr.table.text.replace('\n0', ',').replace('\n', ',').strip(',') print('期号:%s\t时间:%s\t号码:%s' % (str(issue), str(time_str), str(num_code))) issue_db = select_db(issue, db_table) try: if issue_db == issue: insert_db(db_table, issue_db, time_str, num_code) print('添加%s到%s成功' % (issue_db, db_table)) except Exception as e: print('%s 已经存在!' % issue_db) print(e) if __name__ == '__main__': flag = 0 now = datetime.datetime.now() sched_time = datetime.datetime(now.year, now.month, now.day, now.hour, now.minute, now.second) + datetime.timedelta(seconds=3) while True: now = datetime.datetime.now() if sched_time < now: time.sleep(3) print(now) my_test() flag = 1 else: if flag == 1: sched_time = sched_time + datetime.timedelta(minutes=2) flag = 0
以上这篇python 爬虫 实现增量去重和定时爬取实例就是小编分享给大家的全部内容了,希望能给大家一个参考,也希望大家多多支持。
免责声明:本站文章均来自网站采集或用户投稿,网站不提供任何软件下载或自行开发的软件!
如有用户或公司发现本站内容信息存在侵权行为,请邮件告知! 858582#qq.com
金钱帮资源网 Copyright www.kbjia.com
暂无“python 爬虫 实现增量去重和定时爬取实例”评论...
稳了!魔兽国服回归的3条重磅消息!官宣时间再确认!
昨天有一位朋友在大神群里分享,自己亚服账号被封号之后居然弹出了国服的封号信息对话框。
这里面让他访问的是一个国服的战网网址,com.cn和后面的zh都非常明白地表明这就是国服战网。
而他在复制这个网址并且进行登录之后,确实是网易的网址,也就是我们熟悉的停服之后国服发布的暴雪游戏产品运营到期开放退款的说明。这是一件比较奇怪的事情,因为以前都没有出现这样的情况,现在突然提示跳转到国服战网的网址,是不是说明了简体中文客户端已经开始进行更新了呢?
更新日志
2024年10月08日
2024年10月08日
- 《丁当 20首重量级歌曲 Fu Good 下一站天后 2CD》[WAV/分轨][650MB]
- 歌莉雅.2012-My.Voice.Story【环星】【FLAC分轨】
- 群星.1993-一曲成名·青春无悔【飞碟】【WAV+CUE】
- 刘德华.2000-爱无知(金装版)【NEWMELODY】【WAV+CUE】
- 许巍《时光漫步》1CD[FLAC/分轨][804.3MB]
- 群星《2024第一季度百度歌曲排行抖音榜top100》1CD[FLAC/分轨][2.3GB]
- 张柏芝《全新经验》[FLAC/分轨][450MB]
- 唐朝.2008-浪漫骑士【音乐家】【WAV+CUE】
- 张芸京.2016-失败的高歌【泡耳音乐】【WAV+CUE】
- 群星.1991-音乐工厂1·皇后大道东【音乐工厂】【WAV+CUE】
- 群星.1992-音乐工厂2·首都【音乐工厂】【WAV+CUE】
- 群星.1994-音乐工厂3·儿童乐园【音乐工厂】【WAV+CUE】
- 胡鸿钧.2021-ex:CHANGE【星梦娱乐】【WAV+CUE】
- 班得瑞原装进口《第一张新世纪专辑:仙境》1CD[APE/CUE分轨][292.3MB]
- 伍佰《摇滚教父 伍佰黄金精选 2CD》[WAV+CUE][990MB]