分类:AI动态 标签:人工智能、大模型、OpenAI、微软
在人工智能狂飙突进的今天,关于训练数据版权与合法性的争议从未停歇。近日,外媒曝光的一批微软内部文件将这一矛盾彻底撕开。微软应用科学总监 Brent Hecht 在内部直言不讳地警告称,大模型厂商无限制地抓取新闻内容来训练 AI,本质上是一次“规模空前的盗窃”,堪称人类历史上最大规模的劳动成果盗窃。
内部文件揭露:AI 正在摧毁网络生态
长期以来,科技巨头们多以“合理使用(Fair Use)”作为大规模抓取公开数据的法律护城河。然而,Brent Hecht 明确表示,这种做法完全是对合理使用理念的公开嘲弄。
除了对创作者权益的侵害,微软的另一份内部文件还指出了更深层的危机——这将形成一个不可逆的“恶性循环”,最终既伤害了依赖高质量内容的 AI 模型本身,也摧毁了整个 Web 互联网生态:
- 流量断崖式下跌:微软的内部数据显示,部分新闻出版商网站的搜索与外链点击率暴跌了 83% 到 93%,其他多数新闻机构的点击率也大幅下滑 51% 到 94%。
- 经济基础崩塌:以 ChatGPT 为代表的 AI 产品正在通过直接提供信息摘要,夺走用户的访问意愿,进而危及新闻出版商赖以生存的广告和订阅经济。
Hecht 坦言,残酷的现实是:“几乎没有人希望自己创作的内容被以这种方式使用,也没有人因此获得合理的报酬。”
高层表态与现实操作的分裂
面对舆论压力,科技巨头在公开场合与私下决策中展现出了微妙的反差。
微软 CEO 萨蒂亚·纳德拉(Satya Nadella)此前在作证时曾公开表态,AI 公司绝对不应该通过绕过付费墙的方式来违反新闻网站的使用条款。
然而,讽刺的是,OpenAI 的内部聊天记录却暴露了截然不同的态度。当某位员工兴奋地通知 OpenAI 总裁格雷格·布罗克曼(Greg Brockman),称其爬虫程序成功找到了绕过《纽约时报》付费墙的技术漏洞时,布罗克曼并没有制止,反而直接回复:“好极了”。这种技术上的“攻防战”无疑让外界对 AI 厂商的合规承诺打上了巨大的问号。
博客编辑点评
AI 技术的繁荣建立在海量人类智慧结晶的基础之上,但“免费白嫖”一切公开内容的野蛮生长时代正在走向终结。
从点击率的暴跌到媒体的集体反弹,版权方与科技巨头的博弈已经进入深水区。如果无法建立可持续的内容反哺机制或公平的授权分成体系,当新闻机构和创作者被彻底榨干并失去生计时,AI 模型的“粮仓”也将面临无米之炊的窘境。如何平衡技术创新与知识产权保护,将是未来数年整个人工智能行业必须解答的生死命题。