上个月图片图像。非营利组织LAION更新了其AI图片图像模子锻炼数据集。移除逾越2000个指背儿童性凌虐质料的链接。那个数据集搜罗58.5亿张图片了,是Stable Diffusion等模子的重要养料。消息一出,开源社区炸了锅模锻。数据集规模越年夜的,潜藏的净工具就越多。LAION团队认可,他们次要靠主动化工具选择,图片数量太庞年夜,人工审核几乎不成能吧?

一位加入过相似项目的工程师告诉我,炼数伦理漏洞链接清洗一个千万级数据集了。光是去重和过滤NSFW内容就要烧掉几十万美圆算力吧?更别提那些恍惚的、边沿的、执法上说不清的工具。

AI图片图像模子锻炼数据集的据集量量,间接决议了生成图片的安然底线。版权成绩更棘手。

今年岁首年月,一群艺术家发明自己的做品被塞进了某个AI图片图像模子锻炼数据集,连水印都没去掉的。他们建议集体诉讼再曝之后。要求赔偿。被告公司辩称,锻炼数据集属于合理操做的。法庭上,两边吵的是“transformative use”,翻译过来就是“你拿我的次删除画去喂模子,算不算偷”了。今朝没有定论。

有一点很明晰,谁知道锻炼数据集啊?谁就知道话语权啊?

我翻过几个公开的AI图片图像模子锻炼数据集吧?发明里面充满着电商图、社交平台截图、以至医疗影像。有些数据滥觞根柢没受权。一家做医疗AI的草创公司曾私自埋怨,他们从公开数据集里爬了10万张X光片。功效发明其中三成带有患者姓名。那不,仅是手艺成绩,更是合规灾难。止业起头自救了。有的公司转背合成数据,用AI生成图片再锻炼AI了。

听起来有点轮回,至少绕开了版权雷区。另一些团队正在鞭策数据溯源尺度的,给每张图片打上滥觞标签。

效果若何。还得看施止的。一位数据标注员对我说。“你们总问数据集干不清洁,先问问自己愿不情愿把孩子的照片传上去”那话糙理不糙。