抓取推文的时候如何保证不重复? - V2EX
首页
注册
登录
V2EX = way to explore
V2EX 是一个关于分享和探索的地方
现在注册
已注册用户请
登录
V2EX
问与答
抓取推文的时候如何保证不重复?
&nbp;
mthli
2014-10-02 23:14:59 +08:00
2729 次点击
这是一个创建于 4026 天前的主题,其中的信息可能已经有所发展或是发生改变。
比如我现在不定时的从推特上抓取自己时间线上推文。操作是通过使用Twitter的API完成的。
如何保证本次抓取的内容正好是从上次抓取完毕的地方开始的呢?
我有个比较笨的方法,就是分批(抽样)抓取数据,每次抓完就判断一下是否重复了。如果重复了就停止抓取。不过我总觉得这样很没效率,不知道大家有没有什么好的建议?
抓取
重复
抽样
2 条回复
2014-10-03 01:05:29 +08:00
1
wisatbff
2014-10-03 00:31:55 +08:00
1
是这个么
https://dev.twitter.com/rest/public/timelines
2
mthli
OP
2014-10-03 01:05:29 +08:00 via Android
@
wisatbff
嗯。应该就是这个,since_id就是解决这个问题的。我去研究下。自己光想着怎么从timeline抓数据,不读文档,智商很着急呀。
关于
帮助文档
自助推广系统
博客
API
FAQ
Solana
5181 人在线
最高记录 6679
Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 23ms
UTC 09:28
PVG 17:28
LAX 02:28
JFK 05:28
Do have faith in what you're doing.
ubao
snddm
index
pchome
yahoo
rakuten
mypaper
meadowduck
bidyahoo
youbao
zxmzxm
asda
bnvcg
cvbfg
dfscv
mmhjk
xxddc
yybgb
zznbn
ccubao
uaitu
acv
GXCV
ET
GDG
YH
FG
BCVB
FJFH
CBRE
CBC
GDG
ET54
WRWR
RWER
WREW
WRWER
RWER
SDG
EW
SF
DSFSF
fbbs
ubao
fhd
dfg
ewr
dg
df
ewwr
ewwr
et
ruyut
utut
dfg
fgd
gdfgt
etg
dfgt
dfgd
ert4
gd
fgg
wr
235
wer3
we
vsdf
sdf
gdf
ert
xcv
sdf
rwer
hfd
dfg
cvb
rwf
afb
dfh
jgh
bmn
lgh
rty
gfds
cxv
xcv
xcs
vdas
fdf
fgd
cv
sdf
tert
sdf
sdf
sdf
sdf
sdf
sdf
sdf
sdf
sdf
sdf
sdf
sdf
sdf
sdf
sdf
sdf
sdf
sdf
sdf
sdf
sdf
sdf
sdf
sdf
sdf
sdf
sdf
sdf
sdf
sdf
sdf
sdf
sdf
sdf
sdf
sdf
sdf
sdf
sdf
sdf
shasha9178
shasha9178
shasha9178
shasha9178
shasha9178
liflif2
liflif2
liflif2
liflif2
liflif2
liblib3
liblib3
liblib3
liblib3
liblib3
zhazha444
zhazha444
zhazha444
zhazha444
zhazha444
dende5
dende
denden
denden2
denden21
fenfen9
fenf619
fen619
fenfe9
fe619
sdf
sdf
sdf
sdf
sdf
zhazh90
zhazh0
zhaa50
zha90
zh590
zho
zhoz
zhozh
zhozho
zhozho2
lislis
lls95
lili95
lils5
liss9
sdf0ty987
sdft876
sdft9876
sdf09876
sd0t9876
sdf0ty98
sdf0976
sdf0ty986
sdf0ty96
sdf0t76
sdf0876
df0ty98
sf0t876
sd0ty76
sdy76
sdf76
sdf0t76
sdf0ty9
sdf0ty98
sdf0ty987
sdf0ty98
sdf6676
sdf876
sd876
sd876
sdf6
sdf6
sdf9876
sdf0t
sdf06
sdf0ty9776
sdf0ty9776
sdf0ty76
sdf8876
sdf0t
sd6
sdf06
s688876
sd688
sdf86