Meta 承认使用盗版书籍来训练 AI,并拒绝赔偿作家
DoNews
2024-01-15 10:16:53

原标题:Meta 承认使用盗版书籍来训练 AI,并拒绝赔偿作家

DoNews1月15日消息,近日,Meta 就因使用包含大量盗版书籍的“Books3”数据集训练其 LLAM 1 和 LLAM 2 模型而面临包括喜剧演员 Sarah Silverman 和作家 Richard Kadrey 在内的一众作者的集体诉讼。Meta 虽承认使用了 Books3 数据集,却拒绝向作者支付适当的补偿。

Books3 是一个包含 19.5 万本图书、总容量近 37GB 的文本数据集,由 AI 研究者 Shawn Presser 于 2020 年创建,旨在为改进机器学习算法提供更好的数据源。

Meta 也将其用于训练自己的 LLAM 模型,然而 Books3 中包含大量从盗版网站 Bibliotik 爬取的受版权保护作品,使得 Meta 的行为面临法律风险。

Meta 的做法并非特例。此前,《纽约时报》也因 OpenAI 和微软使用其文章训练聊天机器人 ChatGPT 而对其提起诉讼。

OpenAI 则辩称,不使用受版权保护的材料来训练 AI 模型“几乎不可能”,并要求法院驳回相关诉讼。Meta 同样否认故意侵犯版权,声称其使用 Books3 数据集属于合理使用范畴,无需获得许可、署名或支付补偿。

此外,Meta 还在对诉讼作为集体诉讼的合法性提出异议,拒绝向提起诉讼的作家或其他参与 Books3 争议的人士提供任何形式的经济“补偿”。

值得注意的是,Books3 数据集中的部分内容来自盗版网站 Bibliotik,该数据集在 2023 年被丹麦反盗版组织 Rights Alliance 要求下架,目前面临数字存档禁令。

相关内容

热门资讯

新模型发布、新实验完成……浦东... 近日,浦东机器人企业接连取得最新技术成果。智元具身研究中心推出两项新成果,为机器人产业注入新动能。微...
兴鸿辉科技取得一种充电桩外壳专... 国家知识产权局信息显示,惠州市兴鸿辉科技有限公司取得一项名为“一种充电桩外壳”的专利,授权公告号CN...
北大团队创出全新计算架构提升算... 1 月 10 日消息,据新华社今日报道,北京大学科研团队在计算技术领域取得一项重要突破,其创造的一种...
对话创维创始人黄宏生:去年光伏... 1月11日,创维集团(00751.HK)创始人黄宏生在2026年度演讲中提及最多的是光伏、AI家电和...
专家解读 | 数据要素推动完善... 文 | 国家工业信息安全发展研究中心副总工程师 汪礼俊 国家数据局发布的《工业制造、现代农业等九个领...