scrapy+mongodb 插入文档的数目不够的原因?-问答-阿里云开发者社区-阿里云

开发者社区> 问答> 正文

scrapy+mongodb 插入文档的数目不够的原因?

落地花开啦 2016-02-27 16:20:41 2218

我使用mongo储存scrapy爬下来的页面数据,在管道中为同时向db和txt中写入结果,结果发现txt有8000多条记录,而db中count才831条,百思不得其解。后来将db中数据导出,发现似乎是item['content'](文章内容)字段内容比较多的就没有成功插入db。后来想了下,似乎是db的单个文档大小有限制,但是这些文本写到txt最多不过几十kb,这到底是什么问题?
附上管道process_item的代码
`def process_item(self, item, spider):
self.file1.write(item['url']+'n'+item['content']+"n")
word_list = list(jieba.cut(item['content']))
for word in word_list:
if len(word)>1:
self.file.write(word+'/')
self.file.write('n1111111111111111111n')
self.collection.insert(dict(item))
log.msg('Item written to MongoDB database %s/%s' % (self.db, self.col),
level=log.DEBUG, spider=spider)
return item`

NoSQL MongoDB Python
分享到
取消 提交回答
全部回答(1)
  • 小六码奴
    2019-07-17 18:49:02

    对于failIndexKeyTooLong ERROR在shell中使用如下命令可以修改活动中的db设置db.getSiblingDB('admin').runCommand( { setParameter: 1, failIndexKeyTooLong: false } )

    0 0
数据库
使用钉钉扫一扫加入圈子
+ 订阅

分享数据库前沿,解构实战干货,推动数据库技术变革

推荐文章
相似问题
推荐课程