分类:AI动态 标签:人工智能、大模型、版权保护、OpenAI


在人工智能狂飙突进的今天,关于数据抓取与版权争议的暗流终于被摆上了台面。近日,一份曝光的微软内部文件显示,该公司应用科学总监 Brent Hecht 直言不讳地警告称,大规模抓取新闻内容来训练 AI 模型的行为,堪称“人类历史上最大规模的劳动盗窃”。

这一内部声音不仅揭示了科技巨头在 AI 军备竞赛中的道德焦虑,也再次将整个行业推向了舆论的风口浪尖。

争议的核心:从“合理使用”到“对理念的嘲弄”

长期以来,各大 AI 厂商普遍援引版权法中的“合理使用”原则,作为其无偿抓取公开网络数据进行模型训练的法律依据。然而,Brent Hecht 在文件中明确表示,这种做法根本不能算作合理使用,而是对该理念赤裸裸的嘲弄。

他坦言一个残酷的现状:几乎没有任何内容创作者希望自己的心血被这样无偿使用,更没有人因此获得过一分钱的报酬。

除了道德层面的拷问,微软的另一份内部文件还指出了更为致命的“恶性循环”:

  1. 伤害生态:AI 抓取和总结内容的行为,直接导致新闻出版商的流量和经济基础遭到毁灭性打击。
  2. 反噬模型:当优质内容的源头(媒体和创作者)因无法获利而难以为继时,AI 未来能够汲取的训练高质量数据也将枯竭,最终伤害模型自身乃至整个 Web 生态。

触目惊心的数字:新闻网站流量骤降

担忧并非空穴来风,内部数据与现实表现高度吻合。

微软自身的监测数据显示,在 AI 搜索与总结功能的冲击下,部分新闻出版商网站的点击率暴跌了 83% 到 93% 之间;而对于其他大多数新闻机构而言,流量降幅也达到了 51% 到 94%。ChatGPT 等生成式 AI 产品的崛起,正在以惊人的速度蚕食传统内容创作者的生存空间。

尽管微软 CEO 纳德拉在公开作证时曾表示,AI 公司绝不应该通过绕过付费墙来违反新闻网站的使用条款,但同行的实际操作却暴露了截然不同的态度。

曝光文件显示,当一名员工向 OpenAI 总裁 Greg Brockman 汇报名为 OpenAI 的爬虫成功找到了绕过纽约时报付费墙的漏洞时,Brockman 的直接反应却是:“好极了”。这种高层默许甚至暗喜的态度,无疑撕开了科技巨头在版权问题上的双重标准。

科技与版权的十字路口

随着生成式 AI 对全网数据的贪婪吞噬,内容创作者与 AI 厂商之间的矛盾已经不可调和。当“创新”的步伐建立在侵蚀人类劳动成果的基础之上,行业亟需建立一套更公平、可持续的价值分配机制。

AI 的未来不能建立在枯竭的内容荒漠之上。如何在技术狂奔与创作者权益之间找到平衡点,将是接下来几年整个数码科技界必须回答的终极命题。