分类:AI动态 标签:人工智能、大模型、版权保护、OpenAI


在人工智能狂飙突进的今天,关于数据抓取与版权的争议从未停止。然而,近期曝光的一系列微软内部文件却将这一矛盾推向了风口浪尖——微软应用科学总监 Brent Hecht 直言不讳地警告称,抓取新闻内容来训练 AI 是一次规模空前的盗窃,可能是人类历史上最大规模的劳动盗窃。

这一言论不仅揭示了科技巨头内部对当前 AI 训练模式的反思,也再次将 OpenAI 与微软等头部厂商推向了舆论的审判台。

内部警告:合理使用理念的嘲弄

长期以来,科技公司普遍以版权法中的“合理使用”作为大规模抓取网络公开数据(包括新闻、博客、艺术作品等)的法律护城河。但 Brent Hecht 在内部文件中明确表示,这种做法完全是对合理使用理念的嘲弄。

他坦言:“几乎没有人希望自己创作的内容被以这种方式使用,也没有人因此获得报酬。”

另一份微软内部文件则进一步指出了这种行为引发的“恶性循环”:AI 厂商无节制地抓取内容,最终会同时伤害到大模型本身以及整个开放网络生态。

数据触目惊心:新闻出版商流量断崖式下跌

OpenAI 的产品(如 ChatGPT 等)在改变用户获取信息方式的同时,也正在侵蚀新闻出版商的经济基础。微软与 OpenAI 的内部数据均证实了这一悲观预测:

  • 部分主流新闻出版商网站的点击率大幅下降 83% - 93%
  • 其他各类新闻机构的点击率也普遍遭遇 51% - 94% 的严重缩水。

当 AI 直接为用户提供总结好的答案时,用户访问原新闻网站的动力荡然无存。这种“抽水机”式的运作模式,正在让高质量新闻内容的生产者面临生存危机。

高层表态与现实操作的分裂

在这场版权与利益的博弈中,微软高层的公开表态与实际业务操作之间似乎存在着微妙的温差。

微软 CEO 纳德拉(Satya Nadella)此前在作证时曾公开表示,AI 公司不应该通过绕过付费墙来违反新闻网站的使用条款。然而,与之形成鲜明对比的是,OpenAI 的内部沟通记录显示:当某位员工向总裁 Greg Brockman 汇报“OpenAI 爬虫意外找到了绕过《纽约时报》付费墙的漏洞”时,Brockman 的直接反应却是“好极了(Awesome)”。

这种技术崇拜与利益驱使下的“擦边球”行为,无疑暴露出行业在面对版权红线时的侥幸心理。

科技与创作者的平衡何在?

AI 的进化依赖于海量的高质量人类数据(Human Data),但如果作为源头的内容创作者被榨干甚至消灭,AI 产业最终也将成为无源之水、无本之木。

如何构建可持续的生态,让大模型的发展反哺内容创作者,已经成为摆在所有科技巨头面前一道无法回避的必答题。如果任由这种“最大规模的劳动盗窃”继续,未来的数字世界或将面临严重的文化荒漠化危机。