牛津大学已允许OpenAI利用其博德利图书馆的历史典籍训练AI模型,内部文件显示这些数字化藏书被用于“构建OpenAI的训练集”。这一消息引发外界对学术机构与AI公司合作透明度的关注。
牛津2025年3月宣布与OpenAI合作数字化馆藏,但公告未提及资料会用于训练模型,教职员工曾担忧此举带来声誉风险并影响大学环保承诺。校方与AI企业的深度绑定,也让外界质疑学术资源是否在未经充分讨论的情况下被商业化利用。
在“NextGenAI”项目下,牛津是唯一英国成员,截至2025年6月已向OpenAI提供12.5万份历史学位论文扫描页及一份1万首的16世纪民谣珍藏集。这些珍贵文献原本主要用于学术研究,如今却成为大模型训练语料的一部分,其使用边界和授权范围成为争议焦点。
校方否认隐瞒机器学习用途,称文献规模有限且已超版权保护期,OpenAI使用权为非排他性,图书馆保留自主发布数字化资源的权利。但批评者认为,即便版权过期,学术机构仍应就AI训练用途向教职员工和社会充分披露,避免公众资源在缺乏监督下流向商业公司。
目前,双方合作仍在推进,后续是否会有更多馆藏被纳入训练集、校方能否平息内部质疑,仍有待观察。这一事件也为全球高校与AI企业的数据合作敲响了透明度的警钟。
