分类:AI动态 标签:人工智能、大模型、版权保护、微软


在人工智能狂飙突进的今天,关于数据抓取与版权归属的争议从未停息。近日,一组曝光的微软内部文件将这一矛盾推向了风口浪尖。微软应用科学总监 Brent Hecht 在内部直言不讳地指出,大规模抓取网络内容来训练 AI 模型的行为,本质上是一次规模空前的盗窃,堪称人类历史上最大规模的劳动盗窃。

撕开“合理使用”的面具

长期以来,各大科技公司一直以“合理使用”(Fair Use)原则来为无偿抓取公开网络数据的行为辩护。然而,Brent Hecht 在内部文件中公开表示,这种做法完全是对合理使用理念的嘲弄。

他坦言:“几乎没有人希望自己创作的内容被以这种方式使用,也没有人因此获得合理的报酬。”这种未经授权的大规模数据采集,正在透支整个数字内容生态的根基。

难以打破的“恶性循环”与流量崩塌

除了对创作者不公,微软的另一份内部文件还指出了这种模式带来的“恶性循环”:这种掠夺式的数据获取方式,最终会同时伤害 AI 模型本身和整个 Web 生态。

随着 ChatGPT 等 AI 工具能够直接总结或提供新闻内容,用户访问新闻源的必要性大大降低。微软的数据显示,部分新闻出版商网站的点击率遭遇了毁灭性打击,降幅高达 83% 到 93% 不等,而其他大多数新闻机构的点击率也下跌了 51% 到 94%。这种趋势正在迅速摧毁新闻出版商赖以生存的经济基础。

高层表态与现实操作的撕裂

面对日益严峻的版权与道德拷问,科技巨头的公开表态与实际行动往往存在微妙的温差。

微软 CEO 纳德拉此前在作证时曾明确表示,AI 公司不应该通过绕过付费墙来违反新闻网站的使用条款。然而,合作伙伴 OpenAI 的内部信息却暴露出截然不同的态度。当有员工向 OpenAI 总裁 Greg Brockman 汇报公司的网络爬虫发现了绕过《纽约时报》付费墙的漏洞时,Brockman 的反应却是“好极了”,这无疑讽刺意味十足。

科技与内容的十字路口

AI 的发展依赖于海量的高质量人类文本,但如果源头的内容创作者无法获得体面的回报,甚至面临生存危机,未来的 AI 又将靠什么来喂养?这场关于版权、劳动价值与技术边界的博弈,才刚刚拉开序幕。