OpenAI 是一家非营利性人工智能研究公司,由于“担心该技术的恶意应用”,其基于人工智能的新型文本生成器的公开版本受到阻碍。
团体昨天透露它一直在训练一个大规模的无监督语言模型,该模型能够以人类提示为起点生成“连贯的文本段落”。
该模型称为 GPT-2,是一个大型模型变压器基于 15 亿个参数的语言模型,在 800 万个网页的数据集上进行训练。
“GPT-2 会根据任意输入启动模型来生成合成文本样本,”得到埃隆·马斯克 (Elon Musk) 和彼得·泰尔 (Peter Thiel) 等人支持的 OpenAI 解释道。
该小组分享了一个例子的数量模型的能力。从“麦莉·赛勒斯今天在好莱坞大道上从 Abercrombie and Fitch 商店行窃时被抓到”这一输入中,它延续了一个本可以由记者轻松撰写的可读故事。从输入“莱戈拉斯和吉姆利向兽人前进,举起武器,发出令人痛苦的战争呐喊”,它完成了一个简短的奇幻故事,配有人物和对话。
“该模型就像变色龙一样;它会适应条件文本的风格和内容。这使用户能够针对他们选择的主题生成现实且连贯的延续,”OpenAi 说。
尽管存在一些限制——例如重复的文本以及研究人员所说的“世界建模失败”,例如水下发生的火灾——该模型能够生成“感觉接近人类质量并在一页或多页文本上显示出连贯性”的结果。
其功能(显示出对许多特定领域语言模型的改进)令人印象深刻,以至于 OpenAI 决定发布更小的、有限的 GPT-2 版本。
该组织表示:“这些样本具有重大的政策意义:大型语言模型变得越来越容易转向可扩展、定制、连贯的文本生成,而这反过来又可以以多种有益和恶意的方式使用。”
研究人员认为,它有可能被用来生成误导性新闻文章、在网上冒充他人、自动生成滥用或伪造的内容以发布在社交媒体上,或者自动生成垃圾邮件和网络钓鱼内容。
“这些发现,再加上合成图像、音频和视频的早期结果,意味着技术正在降低生成虚假内容和开展虚假信息活动的成本。广大公众需要对他们在网上找到的文本更加怀疑,就像‘深度造假’现象要求对图像更加怀疑一样,”他们补充道。
然而,用例并不全是坏事。 OpenAI 预计近期会给人工智能写作助手、更好的对话代理、语言间无监督翻译和更好的语音识别系统等应用带来好处。
