数据整理,我踩过的坑和攒下的招
前阵子把硬盘里散落的表格翻出来,发现光是不同版本的“最终版”就有十七个。最早一份是2019年的,用Excel记每天的通勤时间,后来加了几列天气和心情。现在回头看,那会儿根本不懂什么叫数据整理,就是凭感觉往格子里塞。结果想找某个下雨天的记录,得按Ctrl+F翻半天。
真正让我下决心改的,是去年整理一份阅读清单。我攒了八百多条书摘,来源有Kindle、微信读书、还有手机备忘录里的随手拍。格式五花八门,有的带页码,有的只有一句话。我先做了一件事:把所有内容导进一个临时表,只留四列——日期、书名、原文、标签。这一步就花掉两个周末,但做完之后,排序和筛选突然变得特别顺手。
表格工具其实够用,关键在结构。我的习惯是分三层:最底层是原始数据,一个字不改;中间层做清洗,统一日期格式、去掉重复项;最上层才是给人看的视图,按主题或时间线排列。举个例子,我记录每天喝咖啡的杯数和入睡时间,原始层就是两列数字,中间层算出每周均值,上层画成折线。这样就算中间算错了,原始记录还在,能重新跑一遍。
说到走势,很多人喜欢拿几周的数据画条线,然后 extrapolate 到年底。我干过这事。去年秋天记了两个月的气温,发现十月比九月低,就预测十一月会更冷,结果十一月有几天热到穿短袖。走势能告诉你过去发生了什么,但预测未来得留足误差空间。现在我看走势图只做一件事:检查有没有异常点。比如某天步数突然从八千掉到两百,那多半是手机没带,不是人变懒了。
整理数据最烦的是命名。早期我存文件叫“新建表格1”“副本-副本”,过两周自己都不认识。后来改成一个笨办法:日期加主题加版本,像“2024-03-12_读书_清洗版”。别小看这个,光是找文件的时间,一个月能省下好几个小时。另外,每份表格开头加一行说明,写清楚这表是干嘛的、字段什么意思。三个月后的自己,就是最陌生的读者。
还有个心得是别贪多。刚开始整理时,我恨不得把每件事都记下来:几点起床、午饭吃了什么、刷了多久短视频。结果坚持了十天就崩溃,因为记录本身变成了负担。现在只留三个指标:睡眠时长、专注工作块数、当天最重要的一件事。数据量小了,反而愿意每天花两分钟填。积了半年,回头看这些记录,比什么年度总结都实在。
工具方面,我主力用Excel和Numbers,偶尔用Airtable处理带关联的条目。脚本只写最简单的Python,pandas读CSV,去重和分组,十行以内能搞定。没必要上来就学数据库,除非你的数据超过十万行,或者需要多人同时编辑。对多数人来说,一个结构清晰的表格加上定期备份,已经能解决九成问题。
最后说个反直觉的:整理完的数据,要定期故意不看。我每季度会把表格归档,然后隔一个月再打开。距离感能帮你发现之前忽略的模式,比如某类书摘集中在深夜,或者运动记录总在周三断档。数据整理不是一锤子买卖,它更像养一盆植物,浇水、修剪、偶尔搬去晒晒太阳。你不需要成为专家,只需要比昨天的自己多记一行、多理一列。