“代码复现组刚刚搭出基础模型跑通了第一个极小规模的数据集!理查德,我们过去三年在RNN(循环神经网络)架构上投入的数十亿美金,现在可能变成了一堆废纸。”
理查德的呼吸变得粗重起来。
两年多以前,九天实验室发布了一百五十二层的ReSNet残差网络论文。
那次全球学术界感到的是惊讶。
大家惊讶于中国工程师在解决梯度消失问题上展现出的巧妙工程技巧。
但那仅仅是在现有技术框架内的修补和优化。
这次完全不同。
《AttentiOn IS All YOU Need》直接推翻了现有的技术底座。
总监看着屏幕上复杂的公式,咬着牙继续通报测试进度。
“这套被称为TranSfOrmer的全新架构,在并行计算上的优势太明显了。”
“我们初步估算,只要算力跟得上,它的训练效率理论上比我们现在的RNN高出至少十倍!”
“而且最让我们感到毛骨悚然的是,它在理论上没有性能上限。”
理查德敏锐地捕捉到了核心信息,瞪大了眼睛。
“你的意思是,只要给它喂更多的数据,提供更大的算力集群,它的表现就能无限提升,不会像RNN那样遇到长序列遗忘的瓶颈?”
“是的。”总监回答得很干脆,语气中透着深深的无力感。
“这根本不是什么技术优化,这是一场技术革命的起点。中国的那家实验室,找到了通往通用人工智能的真正钥匙。”
理查德颓然地跌坐回椅子上。
他看着屏幕上那些优美的网络拓扑图,后背已经被冷汗湿透。
这项足以改写人类科技进程的开创性技术,居然诞生在太平洋彼岸的中国实验室里,而一直自诩为全球AI霸主的硅谷,竟然连反应的时间都没有。
不仅是硅谷的巨头。
北美的几所顶尖高校也因为这篇论文炸开了锅。
麻省理工和斯坦福的计算机系,所有的研究小组都停下了手头的日常项目。
白板上写满了论文中的公式和推导过程。
外籍研究员们对着屏幕上的网络拓扑图反复验证。
没有任何一处逻辑漏洞。
甚至连论文中提到的一些实验数据,他们用小型数据集跑出来的结果也完全吻合。
这是无可辩驳的技术实
本章未完,请点击下一页继续阅读!