分类:AI动态 标签:人工智能、大模型、版权保护、微软


在生成式人工智能狂飙突进的今天,海量训练数据的合法性与道德边界正受到前所未有的审视。近期曝光的一系列微软内部文件显示,科技巨头内部对于大模型抓取新闻内容训练的做法,其实并非铁板一块,甚至发出了极其严厉的警告。

内部警告:历史上最大规模的劳动盗窃?

根据曝光的内部文件,微软应用科学总监 Brent Hecht 曾直言不讳地警告称,未经授权抓取新闻内容来训练 AI 模型,是一次规模空前的盗窃行为,堪称“人类历史上最大规模的劳动盗窃”。

他明确表示,这种行为根本不能被归类为“合理使用(Fair Use)”,反而完全是对合理使用理念的公开嘲弄。在这些内部讨论中,微软的另一份文件也指出,这种无节制的抓取正在形成一个“恶性循环”,最终将同时伤害 AI 模型本身以及整个互联网生态。

触目惊心的数据:新闻网站流量断崖式下跌

OpenAI 的核心产品(如 ChatGPT 等)在改变用户获取信息方式的同时,也正在一步步瓦解传统新闻出版商的经济基础。而微软与 OpenAI 内部的数据恰恰印证了这一残酷的预测:

  • 流量暴跌:微软的数据显示,部分新闻出版商网站的点击率大幅下降了 83% 到 93% 不等;而其他大多数新闻机构的点击率也遭遇了 51% 到 94% 的严重下滑。
  • 创作者权益归零:Hecht 坦言,“几乎没有人希望自己创作的内容被以这种方式使用,也没有人因此获得过任何报酬。”

高层的公开表态与暗地里的默许

面对外界对版权和付费墙的质疑,科技巨头们在公开场合与私下里往往呈现出截然不同的态度。

一方面,微软 CEO 萨蒂亚·纳德拉(Satya Nadella)在相关证词中曾明确表示,AI 公司绝对不应该通过绕过付费墙的方式来违反新闻网站的使用条款。

然而,鲜明对比的是 OpenAI 的内部沟通记录。当有员工向总裁格雷格·布罗克曼(Greg Brockman)汇报称,OpenAI 的网络爬虫意外找到了绕过《纽约时报》付费墙的技术漏洞时,布罗克曼的反应竟然是“好极了(Awesome)”。这种态度无疑将 AI 产业在合规边缘试探的野心暴露无遗。

极客视点

从数据的疯狂收割到流量的断崖式下跌,AI 的繁荣正建立在传统内容创作者的血汗之上。当“合理使用”的法律边界被无限拉伸,当爬虫技术公然践踏付费墙时,整个数字内容生态正在走向一个危险的十字路口。

如何在推动技术创新的同时,建立一套可持续的版权回报与利益分配机制,已经成为摆在所有 AI 巨头和监管机构面前一道无法回避的必答题。否则,当优质内容的源头被彻底干涸,AI 的进化之路也必将迎来终结。