java爬取闲鱼商品信息（三） - AaronLin的博客 - CSDN博客

这一篇距离前两篇更新的时间有点久了，最近忙着刷题- -。又笔试了两轮猪厂一轮鹅厂，结果还没出来，不过感觉都凉了。

好了，上次说到没办法获取到动态加载的部分。

我用了phantomjs尝试了一下，多获取到的部分是复杂的js代码，代码量太大了，没找到我们需要的信息。

也可能是我使用的方式不对，要是有可以获得的方法欢迎大家在评论介绍一下，我去试试看。

好了，最后我还是弄到了动态加载的数据，当然不是用的phantomjs。

既然找不到数据，那为什么不问问神奇的fiddler呢。

我们打开fiddler，然后访问闲鱼闲置广场的3C数码。

再看看突然多出来的数据包。

看。我们发现了什么，没错，翻下去我们发现了很多在闲鱼倒卖小米MIX2S的老黄牛。。。。。

更重要的是，发现了需要动态加载出来的数据。。当然这是json格式的数据，被我们拦截下来了。。

然后看看这些个数据的网址。

https://s.2.taobao.com/list/waterfall/waterfall.htm?wp=3&_ksTS=1523262257881_271&callback=jsonp272&stype=1&catid=57544002&oon=10&st_trust=1&ist=1

然后用浏览器打开。

可以看到，是json格式的数据，那这个网址又和我们要的数据有什么关系呢？

https://s.2.taobao.com/list/waterfall/waterfall.htm?wp=3&_ksTS=1523262257881_271&callback=jsonp272&stype=1&catid=57544002&oon=10&st_trust=1&ist=1

再次仔细看一下，这两个参数是我们需要的，catid可以控制商品类型（结合第一篇），而ist则是第几页的动态数据。

接下来的事情就水到渠成了，下载这个页面，正则提取，然后和上一篇的处理方法封装在一起，就变成了一个获取完整的网页的方法。

接下篇，下篇刷阵题更新，不过剩下的都是简单的事情了。

欢迎大家探讨获取网页的其他方法，我这个效率好像还可以但是有些取巧，也没有普适性。

Original url: Access
Created at: 2019-06-24 16:24:12
Category: default
Tags: none

未标明原创文章均为采集，版权归作者所有，转载无需和我联系，请注明原出处，南摩阿彌陀佛，知识，不只知道，要得到

请先后发表评论