用scrapy爬取新闻网站内容,结果爬下来的是一堆乱码?gb2312、utf-8、gbk各种解码都试过了还是不行!仍然是这种乱码 Á½ÓÍÖÜÎåÊÕ¸ß µÚÈý¼¾¶ÈÕÇ·ù´´Ò»Äê¶àÒÔÀ´×î´ó
爬取的网址是:https://link.zhihu.com/?target=http%3A//www.chemall.com.cn/chemall/infocenter/newsfile/2017-10-17/20171017114532.html
储存入MongoDB也是这样
写入的时候别忘记加上 ensure_ascii=False
看了下,编码是gb2312,是asp.net写的伪静态网站。你再检查下
楼上的说得对的。gb2312.