我盯着屏幕上的数字,“十九万八千……这不太对吧?巴勒莫的单月游客数量什么时候上过十九万?”
“数据有问题?”刘洋的声音拔高了一点。
“我查一下,”我说,打开原始数据文件,翻到游客数量那一列,“这里,你看,十月,十九万八千。但是巴勒莫的旅游旺季是夏季,十月应该已经降下来了,怎么可能比八月还高?”
“是不是爬虫爬错了?”张凯问。
“有可能,”刘洋说,“我看看源网站……等一下,这个网站的数据标注有问题,它把‘全年累计’和‘月度数据’混在一起了。这个十九万八应该是全年的累计,不是十月的单月。”
“所以我们的数据里有脏数据,”我深吸一口气,“得重新清洗。”
“又要重新清洗?”刘洋的声音里带着一种“我已经不想再看到这个项目”的疲惫。
“没事没事,”我说,“把那些明显不对的极端值删掉就行。我来弄,很快的。”
我打开stata的do-file编辑器,开始写清洗数据的命令。dropiftourist_number>50000——把单月游客数量超过五万的都删掉,因为巴勒莫的单月游客数量就没超过五万过。
写完,运行。
stata的屏幕上跳出一行字:150observationsdeleted。
一百五十条数据被删掉了。
“好了,”我说,“数据清洗完了,我再跑一下描述性统计。”
这次的结果看起来正常多了。均值、标准差、都在合理范围内,游客数量的最大值是四万八,八月的,符合旅游旺季的规律。
“可以了,”我说,“数据没问题了,我开始跑回归。”
“等等,”周姐说,“你上次说的那个异方差性问题,你打算怎么处理?”
“用稳健标准误,”我说,“white异方差一致估计量,简单粗暴。”
“你确定?”周姐的语气里带着一丝怀疑,“上次教授不是说,稳健标准误只是治标不治本吗?”
“我知道,”我说,“但我们现在没有时间去做加权最小二乘法了。先用稳健标准误顶着,等结果出来了再说。”
我一边说一边在键盘上敲命令,regressconsumptiontourist_numberincomeseason,robust——消费对游客数量、收入、季节的回归,加上稳健标准误。
回车。
stata的屏幕开始
本章未完,请点击下一页继续阅读->>>