分类:AI动态 标签:人工智能、大模型、科技伦理、版权保护


在人工智能狂飙突进的今天,关于数据抓取与版权保护的争议从未停歇。近日,一份曝光的微软内部文件将这一矛盾推向了风口浪尖。微软应用科学总监 Brent Hecht 在文件中直言不讳地警告称,未经授权抓取新闻内容来训练 AI 模型,是一次规模空前的盗窃行为,堪称人类历史上最大规模的劳动成果盗窃。

内部文件揭露:AI 训练与版权保护的不可调和

长期以来,科技巨头们一直援引“合理使用(Fair Use)”原则,为其大规模抓取互联网公开数据训练大模型的行为进行辩护。然而,Brent Hecht 并不认同这一观点。他认为,这种做法完全是对“合理使用”理念的公开嘲弄。

除了对数据来源的道德性质疑,微软的另一份内部文件还指出了这种模式引发的“恶性循环”:

  1. 伤害网络生态:AI 直接抓取并总结内容,导致用户无需访问原始网站。
  2. 打击新闻出版商:微软自身的数据显示,部分新闻出版商网站的点击率大幅下降 83% 到 93%,其他多数机构的点击率也暴跌 51% 到 94%。
  3. 反噬模型本身:优质内容生产者失去经济支撑后,整个 Web 的内容生态将走向枯竭,最终无高质量数据可供模型学习。

Hecht 坦言,现实情况是“几乎没有人希望自己创作的内容被以这种方式使用,也没有人因此获得合理的报酬”。

巨头内部的分歧与矛盾

这场关于数据的争夺战,不仅存在于科技公司与媒体之间,在企业内部甚至行业领袖之间也暴露出微妙的分歧。

微软 CEO 萨蒂亚·纳德拉(Satya Nadella)此前在作证时曾表示,AI 公司不应该通过绕过付费墙或违反新闻网站的使用条款来获取数据。然而,与此形成鲜明对比的是,OpenAI 的内部沟通记录显示出截然不同的态度。当曾有员工向 OpenAI 总裁格雷格·布洛克曼(Greg Brockman)汇报,称公司的网络爬虫发现了绕过《纽约时报》付费墙的漏洞时,布洛克曼的反应竟然是“好极了”。

这种言行背后的反差,无疑加剧了外界对 AI 头部企业合规底线的担忧。随着 ChatGPT 等生成式 AI 产品持续对新闻出版商的经济基础造成实质性威胁,如何平衡技术创新与知识产权保护,已经成为摆在整个科技行业面前一道无法回避的必答题。