AI公司购买珍稀精装书并销毁以提取文本用于训练数据集,引发书籍保护倡导者的担忧。这一做法凸显了AI数据获取与文化遗产保护之间的紧张关系。
背景
大型语言模型训练需要海量文本数据,导致一些AI公司通过扫描和OCR技术从实体书中获取数据源。
- 来源
- Good e-Reader
- 发布时间
- 2026年8月20日 04:44
- 评分
- 5.0 / 10
AI公司购买珍稀精装书并销毁以提取文本用于训练数据集,引发书籍保护倡导者的担忧。这一做法凸显了AI数据获取与文化遗产保护之间的紧张关系。
大型语言模型训练需要海量文本数据,导致一些AI公司通过扫描和OCR技术从实体书中获取数据源。