日期: 2022-09-21 04:27:53 浏览数:15

上往建站提供服务器空间服务商,百度快照排名,网站托管,百度推广运营,致力于设计外包服务与源代码定制开发,360推广,搜狗推广,增加网站的能见度及访问量提升网络营销的效果,主营:网站公司,百度推广公司电话,官网搭建服务,网站服务企业排名,服务器空间,英文域名等业务,专业团队服务,效果好。
瓦房店企业网站设计 - 瓦房店高端网站定制 - 瓦房店品牌网站搭建 - 上往建站

*- coding: utf-8 -*-import scrapyfrom mySpider.items import ItcastItem# 以下三行是在 Python2.x版本中解决乱码问题,Python3.x 版本的可以去掉import sys
reload(sys)sys.setdefaultencoding("utf-8")class Opp2Spider(scrapy.Spider):
name = 'itcast'
allowed_domains = ['itcast.com']
start_urls = ("http://www.itcast.cn/channel/teacher.shtml",)
def parse(self, response):
#open("teacher.html","wb").write(response.body).close()
# 存放老师信息的集合
items = []
for each in response.xpath("//div[@class='li_txt']"):
# 将我们得到的数据封装到一个 `ItcastItem` 对象
item = ItcastItem()
#extract()方法返回的都是unicode字符串
name = each.xpath("h3/text()").extract()
title = each.xpath("h4/text()").extract()
info = each.xpath("p/text()").extract()
#xpath返回的是包含一个元素的列表
item['name'] = name[0]
item['title'] = title[0]
item['info'] = info[0]
items.append(item)
# 直接返回最后数据
return itemshttps://segmentfault.com/a/1190000013178839原文链接:
:https://segmentfault.com/a/1190000013178839
← C 结构体关于 C# 中的变量的初始化问题浅谈 →
3 篇笔记 写笔记
晴天
182***4239@qq.com
参考地址
4
使用 pip 安装 scrapy 过程中失败解决方法
1、(该环境上面有python)安装scrapy的时候,使用pip install scrapy一般会失败。报超时的错误
所以我们需要换另一种形式来安装,我们先将scrapy安装过程中所用到的依赖的库安装完成之后,在安装scrapy,这样子便可以安装成功了。
需要安装的依赖库有 lxml、 pyOpenSSL 、 Twisted 、pywin32。需要注意的是我们安装的这些库,都是通过wheel来安装的。因此在安装这些库之前,先得安装wheel。打开控制台窗口,输入pip install wheel,先安装wheel库。
安装这些库的时候,得注意下载的.whl文件的版本号,需要和自身的python的版本号对应。例如
小编python的版本3.5 64位,则选择下载的.whl的版本为XXX-cp35-cp35-win-amd64.whl:
安装 lxml,到 https://www.lfd.uci.edu/~gohlke/pythonlibs/#twisted ,查询lxml对应环境python的.whl文件。本文使用的是lxml-4.1.0-cp35-cp35m-win_amd64.whl,下载完成之后。在文件的目录起一个控制台窗口,如下图,便可以启动一个控制台。输入pip install lxml-4.1.0-cp35-cp35m-win_amd64.whl ,即可安装成功。如果提示版本不对,那么就是python和whl文件的版本不对应。
安装 pyOpenSSL ,直接在控制台输入 pip install pyOpenSSL,然后等待安装完成。
安装Twisted,在https://www.lfd.uci.edu/~gohlke/pythonlibs/#twisted,网站上面找到适合的安装whl文件,安装的步骤同安装lxml一样。
安装pywin32,在https://sourceforge.net/projects/pywin32/files/pywin32/,找到对应的安装文件,该文件为.exe结尾的文件。直接到下载的保存目录,执行exe文件,然后按照提示安装。
将上述的库安装完成之后,便可以开始安装scrapy。打开控制台,执行pip install scrapy。小编刚开始也是安装scrapy报错,后来将所有的库安装上去之后,边安装成功了。注意过程中可能还会出现超时的问题,遇到这种情况,重试一两次即可。
晴天
晴天
182***4239@qq.com
参考地址
4年前 (2018-12-03)
晴天
182***4239@qq.com
参考地址
4
Scrapy执行crawl命令报错:ModuleNotFoundError: No module named 'win32api'
今天头一次在新电脑上使用scrapy,碰到了不少问题,让我忍不住吐槽。
基本环境:
Windows10
python3.6.2-64bit
问题描述:
在费了半天劲成功安装好scrapy后,crawl报错:“ModuleNotFoundError: No module named ‘win32api’”
解决方法(更新于2017.09.23):
现在回头看来,这同样是一个缺少依赖包的错误,而且只会发生在Windows系统中。
不必像之前在Stack Overflow上查到的那样给Windows系统打补丁,而是直接给python装个库(较之之前的方法,其实给更上层的打个补丁)——pypiwin32。
pip install pypiwin32
(编写于2017.08.18)
在Stack Overflow上搜索到了解决方法,按图索骥,执行了两步操作,成功解决了报错。但是我怀疑其实第一步是冗余的,直接执行第二部即可:
从 http://www.lfd.uci.edu/~gohlke/pythonlibs/#pywin32 下载对应的whl文件并安装。单单执行这一步的话,还会报一个相似的新错:“ImportError: DLL load failed: 找不到指定的模块。”
从 http://sourceforge.net/projects/pywin32/files/pywin32/ 下载对应版本的pywin32。比如我就下载了“pywin32-221.win-amd64-py3.6.exe”。 (小插曲,安装“pywin32-220.win-amd64-py3.6.exe”失败)
晴天
晴天
182***4239@qq.com
参考地址
4年前 (2018-12-03)
tOmMy
era***q.com
28
关于 Python3 在保存抓取文件时候的问题:
代码如下:
filename = "teacher.html"
with open(filename, 'w', encoding='utf-8') as f:
f.write(response.body.decode())
这里需要注意几点:
open 一定要加上 encoding='utf-8',否则在 f.write 的时候会报错。
response.body 返回的是 bytes,需要将其 decode 成 string。
tOmMy
tOmMy
era***q.com
3年前 (2019-05-15)
瓦房店企业网站设计 - 瓦房店高端网站定制 - 瓦房店品牌网站搭建 - 上往建站
上往建站提供搭建网站,域名注册,官网备案服务,网店详情页设计,企业网店,专业网络店铺管理运营全托管公司咨询电话,服务器空间,微信公众号托管,网页美工排版,致力于域名申请,竞价托管,软文推广,全网营销,提供标准级专业技术保障,了却后顾之忧,主营:虚拟主机,网站推广,百度竞价托管,网站建设,上网建站推广服务,网络公司有哪些等业务,专业团队服务,效果好。
服务热线:400-111-6878 手机微信同号:18118153152(各城市商务人员可上门服务)