《AttentiOn IS All YOU Need》。
这篇全英文的预印本学术论文,在深夜十一点被上传到了arXiv平台。
没有新闻发布会,也没有官方账号的预热宣传。
最先发现这篇论文的,是几个长期盯着九天实验室动态的自媒体账号。
他们把论文的标题和摘要截图,直接发到了引力社区和回音平台上。
配文非常简短。
【九天实验室放出了天问大模型的底层架构论文。】
消息刚一发出去,底下的评论区就涌入了大批等待吃瓜的网友。
白天关于天问大模型造假的阴谋论满天飞,大家都等着看回响科技怎么应对。
面对满屏的英文字母和复杂的数学公式,普通网友完全摸不着头脑。
【有没有课代表来总结一下,这东西到底讲了什么?】
【全是大写字母和看不懂的网络拓扑图,这该不会是随便发一篇水文来糊弄人的吧。】
【散了吧,估计是临时拼凑的材料,想敷衍白天的造假指控。】
【连个中文翻译都没有,这是心虚了吧。】
质疑的声音还在继续增加。
十几分钟后,引力社区的一位认证大V发文了。
他的认证头衔是“前百度深度学习实验室高级算法研究员”。
这位大V没有配图,而是直接发了一篇将近四千字的纯文本长文。
文章的开头只有干巴巴的一句话。
“别吵了,回响科技这次直接把AI界的桌子给掀了。”
这句话立刻吸引了数以十万计的流量。
大V在文章里使用了非常通俗的语言,对这篇论文的核心内容进行了拆解。
他解释了传统自然语言处理的痛点。
过去的算法依靠循环神经网络,处理文本必须按照词汇的先后顺序一个一个读取。
这种处理方式不仅计算速度慢,而且句子一旦过长,模型就会忘掉前面的设定。
这导致长文本生成经常出现前言不搭后语的问题。
大V在文章中加粗了一段文字。
“但这篇论文提出了一种全新的TranSfOrmer架构,他们直接抛弃了传统的循环和卷积网络。”
“他们提出了一种自注意力机制。”
“这种机制允许模型在处理一个词时,同时计算句子中所
本章未完,请点击下一页继续阅读!