当前位置:网站首页>AI表现越差,获得奖金越高?纽约大学博士拿出百万重金,悬赏让大模型表现差劲的任务
AI表现越差,获得奖金越高?纽约大学博士拿出百万重金,悬赏让大模型表现差劲的任务
2022-07-05 18:32:00 【智源社区】
模型越大、表现越差反而能获奖?
奖金总计25万美金(折合人民币167万)?
这样“离谱”的事情还真就发生了,一个名叫Inverse Scaling Prize(反规模效应奖)的比赛在推特上引发热议。
该比赛由纽约大学的7位研究人员共同举办。
发起人Ethan Perez表示,本次比赛的主要目的,是希望能找到哪些任务会让大模型表现出反规模效应,从而找出当下大模型预训练中存在的一些问题。
现在,该比赛正在接收投稿中,第一轮投稿将截止到2022年8月27日。
比赛动机
人们似乎默认,随着语言模型越来越大,运行效果也会越来越好。
然而,大型语言模型并非没有缺陷,例如种族、性别和宗教偏见问题,以及产生一些模糊的错误信息等。
规模效应表明,随着参数数量、使用的计算量和数据集大小的增加,语言模型会变得更好(就测试损失和下游性能而言)。
我们假设有些任务的趋势是相反的:随着语言模型的测试损失的提高,任务性能变得单调、效果变得糟糕,我们将这种现象称为反规模效应,与规模效应相反。
本次比赛旨在寻找更多的反规模效应任务,分析哪些类型的任务容易表现出反规模效应,尤其是那些对安全性要求高的任务。
同时,反规模效应任务还将有助于研究当前语言模型预训练和规模范式中潜在的问题。
随着语言模型越来越多地应用于现实世界的应用程序,这项研究的现实意义也在增强。
对反规模效应任务的收集,将有助于降低大型语言模型带来不良后果的风险,并预防伤害到现实用户。
网友争议
但针对这项比赛,有些网友提出了不同的看法:
我认为这是一种误导。因为它假设模型是静态的,并且在经过预训练后停止。
这更多的是一个在参数更多的标准语料库上进行预训练的问题,而不是模型大小的问题。
软件工程师James对该观点表示赞同:
是的,这整件事都是骗局。任何小型模型可以学习的东西,大型模型也可以。
小模型的偏差更大,因此“热狗不是热狗”在小模型中可能被识别为100%对的,而当大模型认识到可以将蛋糕制作成类似于热狗时,准确率会下降到 98%。
James甚至还进一步提出了“阴谋论”的看法:
也许这整件事就是一个骗局——让人们努力干活,并且展示遇到棘手任务时的训练数据,该经验会被大型模型所吸收,大型模型最终会更好。
因此他们不需要给奖金,还会得到一个更好的大型模型。
对此,发起人Ethan Perez在评论里这样写道:
澄清一下,该奖项的重点是寻找会导致反规模效应的语言模型预训练中,从未或很少见过的类别。
这只是使用大型模型的一种方法。还有许多其他能导致反规模效应的设置,没有涵盖在我们的奖项里。
边栏推荐
- [paddleclas] common commands
- Copy the linked list with random pointer in the "Li Kou brush question plan"
- 图片数据不够?我做了一个免费的图像增强软件
- 第十一届中国云计算标准和应用大会 | 云计算国家标准及白皮书系列发布 华云数据全面参与编制
- ConvMAE(2022-05)
- LeetCode 6111. Spiral matrix IV
- JDBC reads a large amount of data, resulting in memory overflow
- Reading notes of Clickhouse principle analysis and Application Practice (5)
- [PM2 details]
- About Estimation with Cross-Validation
猜你喜欢
如何获取飞机穿过雷达两端的坐标
vulnhub之darkhole_2
Tupu software digital twin | visual management system based on BIM Technology
Share: ZTE Yuanhang 30 Pro root unlock BL magick ZTE 7532n 8040n 9041n brush mask original brush package root method Download
node_ Exporter memory usage is not displayed
【HCIA-cloud】【1】云计算的定义、什么是云计算、云计算的架构与技术说明、华为云计算产品、华为内存DDR配置工具说明
分享:中兴 远航 30 pro root 解锁BL magisk ZTE 7532N 8040N 9041N 刷机 刷面具原厂刷机包 root方法下载
Reading notes of Clickhouse principle analysis and Application Practice (5)
LeetCode 6109. 知道秘密的人数
瀚升优品app翰林优商系统开发功能介绍
随机推荐
Maximum artificial island [how to make all nodes of a connected component record the total number of nodes? + number the connected component]
How to choose the most formal and safe external futures platform?
[QNX hypervisor 2.2 user manual]6.3.2 configuring VM
LeetCode 6111. Spiral matrix IV
项目中遇到的问题 u-parse 组件渲染问题
怎么自动安装pythn三方库
[utiliser Electron pour développer le Bureau sur youkirin devrait]
The main thread anr exception is caused by too many binder development threads
Generate XML schema from class
buuctf-pwn write-ups (9)
Gimp 2.10 tutorial "suggestions collection"
U-Net: Convolutional Networks for Biomedical Images Segmentation
使用JMeter录制脚本并调试
Logical words in Articles
node_exporter内存使用率不显示
Tupu software digital twin | visual management system based on BIM Technology
图片数据不够?我做了一个免费的图像增强软件
Simulate the hundred prisoner problem
SAP feature description
The 11th China cloud computing standards and Applications Conference | China cloud data has become the deputy leader unit of the cloud migration special group of the cloud computing standards working