Python爬虫实战：爬取股票信息|电子爱好者

admin管理员组
文章数量:1530965

本次选题是先写好代码再写的文章，绝对可以用到页面元素解析，并且还需要对网站的数据加载有一定的分析，才能得到最终的数据，并且小编找的这两个数据源无 ip 访问限制，质量有保证，绝对是小白练手的绝佳之选。

郑重声明：本文仅用于学习等目的。

分析

首先要爬取股票数据，肯定要先知道有哪些股票吧，这里小编找到了一个网站，这个网站上有股票的编码列表：https://hq.gucheng/gpdmylb.html 。

打开 Chrome 的开发者模式，将股票代码一个一个选出来吧。具体过程小编就不贴了，各位同学自行实现。

我们可以将所有的股票代码存放在一个列表中，剩下的就是找一个网站，循环的去将每一只股票的数据取出来咯。

这个网站小编已经找好了，是同花顺，链接： http://stockpage.10jqka/000001/ 。

想必各位聪明的同学已经发现了，这个链接中的 000001 就是股票代码。

我们接下来只需要拼接这个链接，就能源源不断的获取到我们想要的数据。

实战

首先，还是先介绍一下本次实战用到的请求库和解析库为： Requests 和 pyquery 。数据存储最后还是落地在 Mysql 。

获取股票代码列表

第一步当然是先构建股票代码列表咯，我们先定义一个方法：

def get_stock_list(stockListURL):
    r =requests.get(stockListURL, headers = headers)
    doc = PyQuery(r.text)
    list = []
    # 获取所有 section 中 a 节点，并进行迭代
    for i in doc('.stockTable a').items():
        try:
            href = i.attr.href
            list.append(re.findall(r"\d{6}", href)[0])
        except:
            continue
    list = [item.lower() for item in list]  # 将爬取信息转换小写
    return list

将上面的链接当做参数传入，大家可以自己运行下看下结果，小编这里就不贴结果了，有点长。。。

获取详情数据

详情的数据看起来好像是在页面上的，但是，实际上并不在，实际最终获取数据的地方并不是页面，而是一个数据接口。

http://qd.10jqka/quote.php?cate=real&type=stock&callback=showStockDate&return=json&code=000001

至于是怎么找出来，小编这次就不说，还是希望各位想学爬虫的同学能自己动动手，去寻找一下，多找几次，自然就摸到门路了。

现在数据接口有了，我们先看下返回的数据吧：

showStockDate({"info":{"000001":{"name":"\u5e73\u5b89\u94f6\u884c"}},"data":{"000001":{"10":"16.13","8":"16.14","9":"15.87","13":"78795234.00","19":"1262802470.00","7":"16.12","15":"40225508.00","14":"37528826.00","69":"17.73","70":"14.51","12":"5","17":"945400.00","264648":"0.010","199112":"0.062","1968584":"0.406","2034120":"9.939","1378761":"16.026","526792":"1.675","395720":"-948073.000","461256":"-39.763","3475914":"313014790000.000","1771976":"1.100","6":"16.12","11":""}}})

很明显，这个结果并不是标准的 json 数据，但这个是 JSONP 返回的标准格式的数据，这里我们先处理下头尾，将它变成一个标准的 json 数据，再对照这页面的数据进行解析，最后将分析好的值写入数据库中。

def getStockInfo(list, stockInfoURL):
    count = 0
    for stock in list:
        try:
            url = stockInfoURL + stock
            r = requests.get(url, headers=headers)
            # 将获取到的数据封装进字典
            dict1 = json.loads(r.text[14: int(len(r.text)) - 1])
            print(dict1)

            # 获取字典中的数据构建写入数据模版
            insert_data = {
                "code": stock,
                "name": dict1['info'][stock]['name'],
                "jinkai": dict1['data'][stock]['7'],
                "chengjiaoliang": dict1['data'][stock]['13'],
                "zhenfu": dict1['data'][stock]['526792'],
                "zuigao": dict1['data'][stock]['8'],
                "chengjiaoe": dict1['data'][stock]['19'],
                "huanshou": dict1['data'][stock]['1968584'],
                "zuidi": dict1['data'][stock]['9'],
                "zuoshou": dict1['data'][stock]['6'],
                "liutongshizhi": dict1['data'][stock]['3475914']
            }
            cursor.execute(sql_insert, insert_data)
            connmit()
            print(stock, '：写入完成')
        except:
            print('写入异常')
            # 遇到错误继续循环
            continue

这里我们加入异常处理，因为本次爬取的数据有些多，很有可能由于某些原因抛出异常，我们当然不希望有异常的时候中断数据抓取，所以这里添加异常处理继续抓取数据。

完整代码

我们将代码稍作封装，完成本次的实战。

import requests
import re
import json
from pyquery import PyQuery
import pymysql

# 数据库连接
def connect():
    conn = pymysql.connect(host='localhost',
                           port=3306,
                           user='root',
                           password='password',
                           database='test',
                           charset='utf8mb4')

    # 获取操作游标
    cursor = conn.cursor()
    return {"conn": conn, "cursor": cursor}

connection = connect()
conn, cursor = connection['conn'], connection['cursor']

sql_insert = "insert into stock(code, name, jinkai, chengjiaoliang, zhenfu, zuigao, chengjiaoe, huanshou, zuidi, zuoshou, liutongshizhi, create_date) values (%(code)s, %(name)s, %(jinkai)s, %(chengjiaoliang)s, %(zhenfu)s, %(zuigao)s, %(chengjiaoe)s, %(huanshou)s, %(zuidi)s, %(zuoshou)s, %(liutongshizhi)s, now())"

headers = {
    'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/78.0.3904.108 Safari/537.36'
}

def get_stock_list(stockListURL):
    r =requests.get(stockListURL, headers = headers)
    doc = PyQuery(r.text)
    list = []
    # 获取所有 section 中 a 节点，并进行迭代
    for i in doc('.stockTable a').items():
        try:
            href = i.attr.href
            list.append(re.findall(r"\d{6}", href)[0])
        except:
            continue
    list = [item.lower() for item in list]  # 将爬取信息转换小写
    return list

def getStockInfo(list, stockInfoURL):
    count = 0
    for stock in list:
        try:
            url = stockInfoURL + stock
            r = requests.get(url, headers=headers)
            # 将获取到的数据封装进字典
            dict1 = json.loads(r.text[14: int(len(r.text)) - 1])
            print(dict1)

            # 获取字典中的数据构建写入数据模版
            insert_data = {
                "code": stock,
                "name": dict1['info'][stock]['name'],
                "jinkai": dict1['data'][stock]['7'],
                "chengjiaoliang": dict1['data'][stock]['13'],
                "zhenfu": dict1['data'][stock]['526792'],
                "zuigao": dict1['data'][stock]['8'],
                "chengjiaoe": dict1['data'][stock]['19'],
                "huanshou": dict1['data'][stock]['1968584'],
                "zuidi": dict1['data'][stock]['9'],
                "zuoshou": dict1['data'][stock]['6'],
                "liutongshizhi": dict1['data'][stock]['3475914']
            }
            cursor.execute(sql_insert, insert_data)
            connmit()
            print(stock, '：写入完成')
        except:
            print('写入异常')
            # 遇到错误继续循环
            continue
def main():
    stock_list_url = 'https://hq.gucheng/gpdmylb.html'
    stock_info_url = 'http://qd.10jqka/quote.php?cate=real&type=stock&callback=showStockDate&return=json&code='
    list = get_stock_list(stock_list_url)
    # list = ['601766']
    getStockInfo(list, stock_info_url)

if __name__ == '__main__':
    main()

成果

最终小编耗时 15 分钟左右，成功抓取数据 4600+ 条，结果就不展示了。

关于Python学习指南

学好 Python 不论是就业还是做副业赚钱都不错，但要学会 Python 还是要有一个学习规划。最后给大家分享一份全套的 Python 学习资料，给那些想学习 Python 的小伙伴们一点帮助！

包括：Python激活码+安装包、Python web开发，Python爬虫，Python数据分析，人工智能、自动化办公等学习教程。带你从零基础系统性的学好Python！

👉Python所有方向的学习路线👈

Python所有方向路线就是把Python常用的技术点做整理，形成各个领域的知识点汇总，它的用处就在于，你可以按照上面的知识点去找对应的学习资源，保证自己学得较为全面。（全套教程文末领取）

👉Python学习视频600合集👈

观看零基础学习视频，看视频学习是最快捷也是最有效果的方式，跟着视频中老师的思路，从基础到深入，还是很容易入门的。

温馨提示：篇幅有限，已打包文件夹，获取方式在：文末

👉Python70个实战练手案例&源码👈

光学理论是没用的，要学会跟着一起敲，要动手实操，才能将自己的所学运用到实际当中去，这时候可以搞点实战案例来学习。

👉Python大厂面试资料👈

我们学习Python必然是为了找到高薪的工作，下面这些面试题是来自阿里、腾讯、字节等一线互联网大厂最新的面试资料，并且有阿里大佬给出了权威的解答，刷完这一套面试资料相信大家都能找到满意的工作。

👉Python副业兼职路线&方法👈

学好 Python 不论是就业还是做副业赚钱都不错，但要学会兼职接单还是要有一个学习规划。

👉 这份完整版的Python全套学习资料已经上传，朋友们如果需要可以扫描下方CSDN官方认证二维码或者点击链接免费领取【保证100%免费】

本文标签：爬虫实战股票信息 Python

版权声明：本文标题：Python爬虫实战：爬取股票信息内容由热心网友自发贡献，该文观点仅代表作者本人，转载请联系作者并注明出处：https://m.elefans.com/dongtai/1725442054a1023691.html，本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。如发现本站有涉嫌抄袭侵权/违法违规的内容，一经查实，本站将立刻删除。

更多相关文章

xp系统

电子爱好者 - 最新技术资讯及电子产品介绍！

Python爬虫实战：爬取股票信息

分析

实战

获取详情数据

完整代码

成果

关于Python学习指南

👉Python所有方向的学习路线👈

👉Python学习视频600合集👈

温馨提示：篇幅有限，已打包文件夹，获取方式在：文末

👉Python70个实战练手案例&源码👈

👉Python大厂面试资料👈

👉Python副业兼职路线&方法👈

更多相关文章

python通过调用OPENAI API(ChatGPT)快速提取参考文献的标题信息

QQ邮箱登录PC布局实战笔记四

6.网络安全渗透测试—[信息收集篇6]—[Email信息收集]

web入门——ctfshow（3-20）（信息搜集）

linux定时爬虫并把内容发给自己的邮箱

【数据采集】亮数据浏览器、亮网络解锁器实战指南

win10-cmd查看硬盘接口信息

python打开chrome浏览器的2种方法

python实现数据恢复软件_恢复python

【python】零基础从入门到精通(六）

python笔记19年8月23日

苹果笔记本适合学python吗_MacBook Pro适合深度学习吗？

运维Python大全

uefi装完系统后无法引导_【修正】实战WIN10+UEFI引导装系统(不重装不格盘100%成功)...

amd显卡安装linux,告诉你完美安装Ubuntu 12.10最新AMD显卡驱动实战的方法及命令

Vulnstack红日安全内网域渗透靶场1实战

[网络安全自学篇] 七十五.Vulnhub靶机渗透之bulldog信息收集和nc反弹shell（三）

Android开发实战《手机安全卫士》——13.“缓存清理”模块实现

目标检测YOLO实战应用案例100讲-基于多尺度特征融合的水下小目标检测方法研究

电脑各种中英文信息对照及错误信息总汇 系统出错信息及解决方案

发表评论

推荐文章

u盘不能格式化怎么办

win10 安装 pycrypto 的方法

设置无线网登陆连接到服务器,路由器设置登录连接到服务器

便携式无线共享服务器,便携式无线上网的功能是什么？随身WiFi的特点是什么？ | 192.168.1.1手机登陆...

盘点那些不为大众所知，却暗地里很“牛逼”的软件

热门文章

【2024最新】3分钟速成：结合ChatGPT 4.0与MindShow高效制作PPT

vector commitment

一个U盘搞定统信UOS+银河麒麟的安装

Win10：将打开文件管理器快速访问改为我的电脑

Chrome浏览器无法登录知乎、b站解决方案

AMD的GPU拿来跑深度学习？Rocm3.0&amp;Pytorch@Ubuntu16编译实录

DELL XPS15-9560 WIN10+Ubuntu双系统（固态+机械）安装总结

Linux基本使用-vmware及centos安装-day01

Keil MDK最新版 5.25介绍及下载地址

计算机无法安装ae,Windows10系统AE软件无法安装如何处理

最新文章

Linux-4.x_x_64 内核配置选项简介

Linux-4.4-x86_64 内核配置选项简介

SATA工作模式咋选？揭秘AHCI和IDE区别（全文）

Windebug专题

Linux内核配置选项简介

Dell服务器做磁盘阵列

双系统安装-UEFI启动的Ubuntu 16.04 + 原装Win 10 （XPS 13）

电脑硬件知识大全(二)

一台电脑两个人用,省钱又省电(转)

lnwdh笔记

XP瘦身提速大法

Word、Excel操作技巧大全

DELL 1420 笔记本 BIOS设置

电脑故障修复

- Java基础（1）

小米手机肿么还原时钟

15000流明是多少瓦

一般普通投影机功率多大?

苹果绿联转换器有些投影机不能用

坚果V9投影机具体参数?

有关九年级作文850字精选

80后90后_高一作文

中级卫生专业资格中医全科学主治医师中级模拟题2021年(9)案与解析

(精品)师范大学招考硕士研究生课程八六0试卷

ZXMVC8900(V3

【模拟人生4（The Sims 4）性感露背黑色亮片礼服MOD V20190313】模拟人生4（The Sims 4）性感露背黑色亮片礼服MOD V20190313 官方免费下载

电脑各种中英文信息对照及错误信息总汇系统出错信息及解决方案

AMD的GPU拿来跑深度学习？Rocm3.0&Pytorch@Ubuntu16编译实录

【鬼泣5（Devil May Cry V）v1.0十四项修改】鬼泣5（Devil May Cry V）v1.0十四项修改官方免费下载