HN精选|谷歌DMCA反爬被法官驳回

谷歌DMCA反爬被驳回,搜索结果无版权

去年12月,谷歌援引《数字千年版权法》(DMCA)第1201条”反规避”条款,起诉搜索结果抓取服务商 SerpAPI 绕过其反爬系统 SearchGuard。本周,加州北区联邦法院作出裁决:驳回谷歌的全部 DMCA 主张(允许其就更窄范围重新起诉)。Techdirt 的深度解读登上 Hacker News 首页(234分,91条评论),栏目副标题意味深长——”来自’过河拆桥’部”。

背景:AI 时代的”数据收费站”

进入 AI 时代,各类数据的获取权变得前所未有的值钱,越来越多的平台试图在开放网络上架设”收费站”,主要瞄准 AI 公司,但普通开发者也被一并挡在门外。SerpAPI 的业务如其名:为搜索引擎结果页(SERP)提供”非官方 API”。去年秋天,Reddit 率先起诉 SerpAPI 及 Perplexity 等公司,声称 SerpAPI 通过抓取谷歌结果让第三方间接访问 Reddit 内容,违反 DMCA 1201。几个月后谷歌跟进,矛头同样对准 SerpAPI。

裁决要点:DMCA 管不着”没有版权的东西”

法院认可了 SerpAPI 的两个核心抗辩:

第一,SearchGuard 保护的对象不是版权作品。SearchGuard 本质是一种 JavaScript 挑战验证码:对来自未识别来源的搜索请求下发 JS 题目,真人浏览器自动完成,大规模自动化系统则无法作答。但谷歌自己的诉状写明,搜索结果是”从互联网获取的公开信息的汇编,按相关度组织呈现”——谷歌并未主张搜索结果本身受版权法保护,只说结果”经常”附带可能含第三方授权版权图片的”知识面板”(Knowledge Panel),且并非总是包含。法院据此认定:当 SearchGuard 控制的是不含版权内容的搜索结果访问时,谈不上”有效控制受版权保护作品的技术措施”,DMCA 1201(a)(1)(A) 与 1201(a)(2) 主张在法律上即应驳回。

第二,”经版权所有者授权”是法定要件。§1201(a)(3)(B) 要求技术措施须”经版权所有者授权”方能”有效控制作品访问”。搜索结果中内容的版权属于各网站所有者,谷歌并未获得他们授权来部署 SearchGuard”代为保护”。谷歌辩称该短语只限定”谁能规避措施”而非”谁能部署措施”,法院援引 VidAngel 与 Corley 两案指出那些判例解释的是另一条款(1201(a)(3)(A)),不予采纳。

并非终局,但战场被大幅压缩

谷歌可以重新起诉,但范围被压缩到其确实拥有版权的内容——比如知识面板中的部分素材。Techdirt 直言:那样做顶多能恶心一下 SerpAPI,而 SerpAPI 理论上只需在抓取时避开谷歌自制内容即可。文章结尾点出整件事的讽刺之处:谷歌的整个商业帝国建立在抓取全网之上,如今别人来抓谷歌,它就起诉——这像是在爬上屋顶后把开放互联网的梯子抽走。

社区反响:最关心的是”以后能不能合法抓谷歌”

有读者直接引用《公主新娘》台词调侃谷歌:”你竟敢绑架我合法偷来的东西,太不绅士了。”也有人问出关键问题:”这是不是意味着我们现在都可以合法抓取谷歌搜索结果了?”一位用户指出 SERP 可抓取关乎公共利益:谷歌长期放任 ETA/ESTA 签证诈骗广告(BBC 曾专题报道),可抓取的搜索结果让独立监督成为可能。还有人抱怨:谷歌自己废弃了官方搜索 API,第三方抓取成了唯一选择,”除非他们回心转意,否则我继续用抓取的”。

分析:反规避条款的边界被再次划线

DMCA 1201 自诞生起就因措辞宽泛而争议不断——打印机墨水、车库门遥控器都曾被包装成”技术保护措施”用来打击第三方。这次裁决重申了一条清晰边界:反规避条款保护的是版权作品,不是商业模式。对 AI 数据生态而言,这是一个不小的信号:不含版权内容的公开信息汇编,平台无法用 DMCA 1201 来圈地。Reddit 诉 SerpAPI 案仍在推进,本案的说理很可能被援引。当然,谷歌与平台方还有合同、CFAA 等其他武器,”抓取战争”远未结束——但用最顺手的那件武器,已经先折了一阵。

原文:Judge Rejects Google’s Attempt To DMCA Its Way Out Of Being Scraped – Techdirt
HN 讨论(91条):news.ycombinator.com/item?id=49073513

Leave a Reply

Your email address will not be published. Required fields are marked *