这几天 GitHub 上最热闹的事,大概就是 DeepSeek Harness 了。8 月 13 号开源,12 小时破了 5 万星,一周不到冲到十六七万,插件也滚到了五千多个。我平时不太追这种热点,这回多看了两眼——它主打"一切皆插件",模型、工具、技能、沙箱全是插件,我就寻思,那我这干数据采集的,是不是装个插件、跟它说句话,就能把活干了?

翻了翻源码和插件市场,我得出个不太一样的结论。先说 Harness 本身,它真没什么好黑的。底层那个 Cordis 内核挺讲究,插件能热插拔,卸掉之后副作用还能撤销,这在 Agent 框架里算硬功夫。但问题是,不少人把这东西理解岔了,以为"Agent 能自动化"就等于"Agent 能抓数据"。这俩差着十万八千里。

我接数据采集的单子有阵子了,慢慢摸出个规律。没反爬的网站,Playwright 脚本五分钟写完,谁都能抓,这种活最不值钱,客户自己找个教程就对付过去了。真把人卡住的,是目标站带反爬的时候。拿知乎说,我之前破它那个回答编辑器,Draft.js 的输入框,AI 生成的第一版代码点进去压根不动,最后是我手动逆了半天它的事件绑定,才搞清到底该 dispatch 哪个事件。这种活,Agent 帮不上忙——它能给你一套"看着对、跑起来错"的代码,但不会替你去逆那个 JS。

我自己的体会是,深度反爬这行,靠的从来不是工具多强,是人得真趴下去看过目标站的网络请求、真逆过它的 JS。影刀、九头虫那类 RPA,模拟鼠标点,点的是页面上看得见的数据,这没问题;可登录态、签名、字体加密、WAF 这些,全是专门给你下套的,通用工具一碰就露馅。DeepSeek Harness 再能打,它说到底是个执行底座,不是反爬底座。

所以现在有人来问我"能不能装个插件,自动把小红书或者抖音的数据抓下来",我都会先反问一句:你要抓的那个站,有没有反爬。要是有,这事就不是装个插件能摆平的,得看具体站点、具体接口、具体签名,一个站一个样。这类搞不定的活我现在也接,闲鱼搜「反爬 数据采集」能找到我,或者直接私信发链接,我先帮你判断能不能做、大概什么价。

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐