如题
版权声明:本文内容由阿里云实名注册用户自发贡献,版权归原作者所有,阿里云开发者社区不拥有其著作权,亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容,填写侵权投诉表单进行举报,一经查实,本社区将立刻删除涉嫌侵权内容。
信息源一多就管不过来,我订阅的媒体加起来二十多个,每天全翻一遍得俩小时。
后来自己搭了个聚合:用亮数据的 Web Scraper API,把各媒体的列表页 URL 传进去,返回结构化的标题、摘要、正文和发布时间,不用为一站点写一套爬虫规则。抓下来的文章先做去重,标题算个 simhash 指纹,相似度高的只留最早一条——同一个热点十家媒体都在写,没必要看十遍。
再按来源权重和关键词打分,科技类权重高,娱乐类直接过滤。每天早上八点推送一份日报,十条以内,强迫自己只看最重要的。跑了几个月,感觉最大的变化是焦虑少了,以前总觉得错过什么,现在知道重要的东西脚本不会漏。
技术上要注意的是列表页结构会变,亮数据的Web Scraper API 的好处是模板他们维护,坏掉的站点自己重配一下就行。文章正文别只存摘要,全文本落库,以后想做全文检索或者回顾某事件时,原始数据都在。