搜了八年,我攒下这几条搜索技巧
最早用搜索引擎,我是那种输入一整句话的人。比如“2020年全国平均气温到底是多少度啊”,然后在一堆旅游攻略和天气新闻里翻半天。后来有次赶稿,需要找某年某省统计年鉴里的一个表格,翻到第三页全是广告,气得我直接把搜索词换成“2020年 平均气温 统计年鉴 filetype:xls”。结果第一页就出了原始文件。那天之后我算是开了窍:搜索引擎不笨,笨的是我给的指令。
第一条最实用的,是用英文双引号把关键词锁死。比如你要找“数字游民”这个概念最早谁提的,搜 数字游民 起源,出来的全是营销号。换成 "数字游民" 起源,那些拆成“数字”“游民”分开匹配的页面就没了。再配合减号,比如 "数据" 报告 -推广 -广告,能砍掉一批干扰项。我现在写选题前,会先用引号把核心词固定住,再加“2023..2024”限定年份,出来的结果干净很多。
第二条是 filetype,这个我逢人就推。找官方数据、行业白皮书,直接 filetype:pdf;找表格,filetype:xls 或者 filetype:csv。有次我想看某城市地铁客流量的长期走势,搜“地铁 客流量 数据”全是新闻稿。改成“地铁 客流量 filetype:xls”之后,翻到一个交通论坛的附件,里面是连续五年的月度记录,连换乘系数都标了。这种文件搜索引擎不一定会给高权重,但一旦找到,比十篇二手分析都值。
第三条是 site,用来锁死信息源。比如你只信某几个机构的报告,就写 site:gov.cn 或者 site:edu.cn,再跟关键词。我有个习惯,做数据类选题时,先 site:stats.gov.cn 找官方口径,再 site:github.com 找有没有人整理过原始记录。有一次搜“城市 人口 走势”,政府站点的结果偏宏观,GitHub 上倒有个仓库把七普数据拆成了区级表格,还附了清洗脚本。两边对着看,基本能判断哪些数字是被加工过的。
第四条是时间限定和搜索工具里的“过去一年”。很多话题的预测类内容时效性极强,比如某款芯片的产能预测,两年前的文章现在看就是笑话。我一般在关键词后面加“2024..2025”,或者直接在工具里选时间范围。这样能过滤掉大量旧文。不过要注意,有些深度报告不会标日期,这时候就得点进去看文末的引用年份。我吃过亏,拿一份2019年的数据去对2023年的走势,差点在稿子里写反。
第五条是学会看搜索结果的“走势”。我指的不是股票那种,而是关键词本身的热度变化。比如你搜一个突然火起来的网络梗,工具会显示相关搜索的上升曲线。如果曲线是三天内陡升,那说明还在发酵期,信息多半零碎;如果平稳爬了半年,那大概率有整理好的长文或维基页面。我找资料时会顺手扫一眼这个,能省下不少判断真伪的功夫。
最后一条,是善用自己的搜索记录。我每周会翻一次浏览器的历史,看看这周搜过哪些词、点开过哪些站。有次发现我反复在搜“数据 可视化 工具”,但每次都没存下来,后来干脆建了个书签文件夹,按“数据源”“工具”“案例”分三类。现在再搜同类问题,先翻自己的记录,往往比重新搜快。搜索这件事,技巧是一部分,剩下的就是把自己走过的路标下来。
这些方法都不复杂,难的是养成习惯。我现在看到一篇好报告,第一反应是看它引用了什么,然后顺着引文去搜原始文件。搜不到就换 filetype,再搜不到就 site 到具体机构。一圈下来,大部分问题都能落到一个可点开的链接上。比起收藏一堆“稍后读”,我更喜欢当场把数据抠出来,记在笔记里。毕竟搜索的终点不是找到,是记下来。