设置

关灯

12、chapter12(第4/9页)

我盯着屏幕上的数字,“十九万八千……这不太对吧?巴勒莫的单月游客数量什么时候上过十九万?”

“数据有问题?”刘洋的声音拔高了一点。

“我查一下,”我说,打开原始数据文件,翻到游客数量那一列,“这里,你看,十月,十九万八千。但是巴勒莫的旅游旺季是夏季,十月应该已经降下来了,怎么可能比八月还高?”

“是不是爬虫爬错了?”张凯问。

“有可能,”刘洋说,“我看看源网站……等一下,这个网站的数据标注有问题,它把‘全年累计’和‘月度数据’混在一起了。这个十九万八应该是全年的累计,不是十月的单月。”

“所以我们的数据里有脏数据,”我深吸一口气,“得重新清洗。”

“又要重新清洗?”刘洋的声音里带着一种“我已经不想再看到这个项目”的疲惫。

“没事没事,”我说,“把那些明显不对的极端值删掉就行。我来弄,很快的。”

我打开stata的do-file编辑器,开始写清洗数据的命令。dropiftourist_number>50000——把单月游客数量超过五万的都删掉,因为巴勒莫的单月游客数量就没超过五万过。

写完,运行。

stata的屏幕上跳出一行字:150observationsdeleted。

一百五十条数据被删掉了。

“好了,”我说,“数据清洗完了,我再跑一下描述性统计。”

这次的结果看起来正常多了。均值、标准差、都在合理范围内,游客数量的最大值是四万八,八月的,符合旅游旺季的规律。

“可以了,”我说,“数据没问题了,我开始跑回归。”

“等等,”周姐说,“你上次说的那个异方差性问题,你打算怎么处理?”

“用稳健标准误,”我说,“white异方差一致估计量,简单粗暴。”

“你确定?”周姐的语气里带着一丝怀疑,“上次教授不是说,稳健标准误只是治标不治本吗?”

“我知道,”我说,“但我们现在没有时间去做加权最小二乘法了。先用稳健标准误顶着,等结果出来了再说。”

我一边说一边在键盘上敲命令,regressconsumptiontourist_numberincomeseason,robust——消费对游客数量、收入、季节的回归,加上稳健标准误。

回车。

stata的屏幕开始


本章未完,请点击下一页继续阅读->>>