import urllib2;
import urllib;
import time;
import re;
url= str("http://technet.microsoft.com/en-us/windows/release-info/");
req = urllib2.Request(url);
req.add_header("User-Agent","Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/47.0.2526.106 Safari/537.36");
response=urllib2.urlopen(req);
html=response.read();
print "html=",html;
你可以用chrome的network查看就知道了,这个页面是异步加载返回的,它不是直接返回请求的数据,所以你爬虫只能抓取到最开始的部分数据,后面的数据是由Javascript异步加载进来的
你可以用python的selenium库,用webdriver加载页面来获取内容,然后再用xpath解析里面的数据