用scrapy爬虫无数据

2023-10-27

@[TOC]用scrapy爬虫不到数据，求大神解决

运行后终端显示：
D:\BaiduNetdiskDownload\jobui>C:/Users/admin/AppData/Local/Programs/Python/Python36-32/python.exe d:/BaiduNetdiskDownload/jobui/main.py
2020-02-07 22:29:33 [scrapy.utils.log] INFO: Scrapy 1.8.0 started (bot: jobui)
2020-02-07 22:29:33 [scrapy.utils.log] INFO: Versions: lxml 4.5.0.0, libxml2 2.9.5, cssselect 1.1.0, parsel 1.5.2, w3lib 1.21.0, Twisted 19.10.0, Python 3.6.3 (v3.6.3:2c5fed8, Oct 3 2017, 17:26:49) [MSC v.1900 32 bit
(Intel)], pyOpenSSL 19.1.0 (OpenSSL 1.1.1d 10 Sep 2019), cryptography 2.8, Platform Windows-7-6.1.7601-SP1
2020-02-07 22:29:33 [scrapy.crawler] INFO: Overridden settings: {‘BOT_NAME’: ‘jobui’, ‘DOWNLOAD_DELAY’: 3, ‘NEWSPIDER_MODULE’: ‘jobui.spiders’, ‘SPIDER_MODULES’: [‘jobui.spiders’], ‘USER_AGENT’: ‘Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.132 Safari/537.36’}
2020-02-07 22:29:33 [scrapy.extensions.telnet] INFO: Telnet Password: 1ab83f8133d075be
2020-02-07 22:29:33 [scrapy.middleware] INFO: Enabled extensions:
[‘scrapy.extensions.corestats.CoreStats’,
‘scrapy.extensions.telnet.TelnetConsole’,
‘scrapy.extensions.logstats.LogStats’]
2020-02-07 22:29:34 [scrapy.middleware] INFO: Enabled downloader middlewares:
[‘scrapy.downloadermiddlewares.httpauth.HttpAuthMiddleware’,
‘scrapy.downloadermiddlewares.downloadtimeout.DownloadTimeoutMiddleware’,
‘scrapy.downloadermiddlewares.defaultheaders.DefaultHeadersMiddleware’,
‘scrapy.downloadermiddlewares.useragent.UserAgentMiddleware’,
‘scrapy.downloadermiddlewares.retry.RetryMiddleware’,
‘scrapy.downloadermiddlewares.redirect.MetaRefreshMiddleware’,
‘scrapy.downloadermiddlewares.httpcompression.HttpCompressionMiddleware’,
‘scrapy.downloadermiddlewares.redirect.RedirectMiddleware’,
‘scrapy.downloadermiddlewares.cookies.CookiesMiddleware’,
‘scrapy.downloadermiddlewares.httpproxy.HttpProxyMiddleware’,
‘scrapy.downloadermiddlewares.stats.DownloaderStats’]
2020-02-07 22:29:34 [scrapy.middleware] INFO: Enabled spider middlewares:
[‘scrapy.spidermiddlewares.httperror.HttpErrorMiddleware’,
‘scrapy.spidermiddlewares.offsite.OffsiteMiddleware’,
‘scrapy.spidermiddlewares.referer.RefererMiddleware’,
‘scrapy.spidermiddlewares.urllength.UrlLengthMiddleware’,
‘scrapy.spidermiddlewares.depth.DepthMiddleware’]
2020-02-07 22:29:35 [scrapy.middleware] INFO: Enabled item pipelines:
[‘jobui.pipelines.JobuiPipeline’]
2020-02-07 22:29:35 [scrapy.core.engine] INFO: Spider opened
2020-02-07 22:29:35 [scrapy.extensions.logstats] INFO: Crawled 0 pages (at 0 pages/min), scraped 0 items (at
0 items/min)
2020-02-07 22:29:35 [scrapy.extensions.telnet] INFO: Telnet console listening on 127.0.0.1:6023
2020-02-07 22:29:35 [scrapy.core.engine] DEBUG: Crawled (200) <GET https://www.jobui.com/rank/company/> (referer: None)
2020-02-07 22:29:35 [scrapy.core.engine] INFO: Closing spider (finished)
2020-02-07 22:29:36 [scrapy.statscollectors] INFO: Dumping Scrapy stats:
{‘downloader/request_bytes’: 300,
‘downloader/request_count’: 1,
‘downloader/request_method_count/GET’: 1,
‘downloader/response_bytes’: 6414,
‘downloader/response_count’: 1,
‘downloader/response_status_count/200’: 1,
‘elapsed_time_seconds’: 0.740043,
‘finish_reason’: ‘finished’,
‘finish_time’: datetime.datetime(2020, 2, 7, 14, 29, 36, 65906),
‘log_count/DEBUG’: 1,
‘log_count/INFO’: 10,
‘response_received_count’: 1,
‘scheduler/dequeued’: 1,
‘scheduler/dequeued/memory’: 1,
‘scheduler/enqueued’: 1,
‘scheduler/enqueued/memory’: 1,
‘start_time’: datetime.datetime(2020, 2, 7, 14, 29, 35, 325863)}
2020-02-07 22:29:36 [scrapy.core.engine] INFO: Spider closed (finished)

我的爬虫主程序：
import scrapy
import bs4
from …items import JobuiItem

class JobuiSpider(scrapy.Spider):
name = ‘jobs’
allowed_domins = [‘https://www.jobui.com’]
start_urls = [‘https://www.jobui.com/rank/company/’]

def parse(self,response):
    bs = bs4.BeautifulSoup(response.text,'html.parser')
    ul_list = bs.find_all('ul',class_="textlist flsty cfix")
    for ul in ul_list:
        a_list = ul.find_all('a')
        for a in a_list:
            company_id = a['href']
            url = 'https://www.jobui.com{id}jobs'
            real_url = url.format(id=company_id)
            yield scrapy.Request(real_url,callback=self.parse_job)

def parse_job(self,response):
    bs = bs4.BeautifulSoup(response.text,'html.parser')
    company = bs.find(id="companyH1").text
    datas = bs.find_all('div',class_="c-job-list")
    for data in datas:
        item = JobuiItem()
        item['company'] = company
        item['position'] = data.find('a').find('h3').text
        spantexts = data.find_all('span')
        item['address'] = spantexts[0].text
        item['detail'] = spantexts[1].text
        yield item

setting.py:

-- coding: utf-8 --

Scrapy settings for jobui project

For simplicity, this file contains only settings considered important or

commonly used. You can find more settings consulting the documentation:

https://docs.scrapy.org/en/latest/topics/settings.html

https://docs.scrapy.org/en/latest/topics/downloader-middleware.html

https://docs.scrapy.org/en/latest/topics/spider-middleware.html

BOT_NAME = ‘jobui’

SPIDER_MODULES = [‘jobui.spiders’]
NEWSPIDER_MODULE = ‘jobui.spiders’

Crawl responsibly by identifying yourself (and your website) on the user-agent

USER_AGENT =“Mozilla/5.0 (compatible; MSIE 9.0; Windows NT 6.1; Win64; x64; Trident/5.0; .NET CLR 3.5.30729; .NET CLR 3.0.30729; .NET CLR 2.0.50727; Media Center PC 6.0)”,
“Mozilla/5.0 (compatible; MSIE 8.0; Windows NT 6.0; Trident/4.0; WOW64; Trident/4.0; SLCC2; .NET CLR 2.0.50727; .NET CLR 3.5.30729; .NET CLR 3.0.30729; .NET CLR 1.0.3705; .NET CLR 1.1.4322)”,
“Mozilla/4.0 (compatible; MSIE 7.0b; Windows NT 5.2; .NET CLR 1.1.4322; .NET CLR 2.0.50727; InfoPath.2; .NET CLR 3.0.04506.30)”,
“Mozilla/5.0 (Windows; U; Windows NT 5.1; zh-CN) AppleWebKit/523.15 (KHTML, like Gecko, Safari/419.3) Arora/0.3 (Change: 287 c9dfb30)”,
“Mozilla/5.0 (X11; U; Linux; en-US) AppleWebKit/527+ (KHTML, like Gecko, Safari/419.3) Arora/0.6”,
“Mozilla/5.0 (Windows; U; Windows NT 5.1; en-US; rv:1.8.1.2pre) Gecko/20070215 K-Ninja/2.1.1”,
“Mozilla/5.0 (Windows; U; Windows NT 5.1; zh-CN; rv:1.9) Gecko/20080705 Firefox/3.0 Kapiko/3.0”,
“Mozilla/5.0 (X11; Linux i686; U;) Gecko/20070322 Kazehakase/0.4.5”

Obey robots.txt rules

ROBOTSTXT_OBEY = False

Configure maximum concurrent requests performed by Scrapy (default: 16)

#CONCURRENT_REQUESTS = 32

Configure a delay for requests for the same website (default: 0)

See https://docs.scrapy.org/en/latest/topics/settings.html#download-delay

The download delay setting will honor only one of:

#CONCURRENT_REQUESTS_PER_DOMAIN = 16
#CONCURRENT_REQUESTS_PER_IP = 16

Disable cookies (enabled by default)

#COOKIES_ENABLED = False

Disable Telnet Console (enabled by default)

#TELNETCONSOLE_ENABLED = False

Override the default request h

本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系:hwhale#tublm.com(使用前将#替换为@)

大数据

xml