分类:AI动态 标签:人工智能、微软、OpenAI、大模型


在人工智能狂飙突进的今天,关于数据抓取与版权的争议从未停息。近日,外媒曝光的一系列微软内部文件将这一矛盾推向了风口浪尖。微软应用科学总监 Brent Hecht 在内部警告称,无节制地抓取新闻内容来训练 AI 模型,本质上是一次规模空前的盗窃行为,堪称人类历史上最大规模的劳动成果盗窃。

内部文件揭露:AI 训练与版权的尖锐矛盾

长期以来,科技巨头们普遍以“合理使用”为借口,大规模抓取互联网上的公开内容用于大模型训练。然而,Brent Hecht 明确表示,这种做法根本算不上合理使用,简直是对“合理使用”理念的公开嘲弄。

除了对版权的侵犯,微软的另一份内部文件还指出了这种模式引发的“恶性循环”:

  • 伤害创作者:AI 直接回答用户问题,导致新闻出版商的网站流量断崖式下跌。
  • 反噬模型自身:当优质内容创作者因失去经济来源而停止生产内容时,AI 模型的训练也将失去高质量的数据源,最终同时伤害模型本身与整个 Web 生态。

触目惊心的数据:新闻机构流量暴跌

OpenAI 的旗舰产品 ChatGPT 等工具正在深刻威胁着传统新闻出版商的经济基础。而微软与 OpenAI 内部的数据分析恰好证实了这一残酷预测:

部分新闻出版商网站的点击率遭遇了高达 83% 至 93% 的灾难性下降;而其他大多数新闻机构的点击率也普遍下跌了 51% 至 94%。正如 Hecht 所坦言的那样:“几乎没有人希望自己创作的内容被以这种方式使用,更没有人因此获得应有的报酬。”

巨头高管表态不一:从公开反对到暗中默许

面对日益严峻的版权压力,科技巨头的态度显得十分微妙。

微软 CEO 纳德拉此前在作证时公开表示,AI 公司绝对不应该通过绕过付费墙的方式来违反新闻网站的使用条款。然而,戏剧性的是,OpenAI 的内部聊天记录却暴露了截然不同的态度:当某位员工兴奋地通知总裁 Greg Brockman,称 OpenAI 的网络爬虫成功找到了绕过《纽约时报》付费墙的技术漏洞时,Brockman 的回复竟是“好极了”。

科技与人文的博弈

AI 的发展离不开海量数据的滋养,但当这种滋养演变为对创作者劳动成果的无偿掠夺时,行业的长远健康便无从谈起。如何在推动技术创新的同时,建立公平合理的版权收益分配机制,保障内容创作者的生存权益,已经成为摆在所有科技巨头面前一道无法回避的必答题。