《AttentiOn IS All YOU Need》。
这篇全英文的预印本学术论文,在深夜十一点被上传到了arXiv平台。
没有新闻发布会,也没有官方账号的预热宣传。
最先发现这篇论文的,是几个长期盯着九天实验室动态的自媒体账号。
他们把论文的标题和摘要截图,直接发到了引力社区和回音平台上。
配文非常简短。
【九天实验室放出了天问大模型的底层架构论文。】
消息刚一发出去,底下的评论区就涌入了大批等待吃瓜的网友。
白天关于天问大模型造假的阴谋论满天飞,大家都等着看回响科技怎么应对。
面对满屏的英文字母和复杂的数学公式,普通网友完全摸不着头脑。
【有没有课代表来总结一下,这东西到底讲了什么?】
【全是大写字母和看不懂的网络拓扑图,这该不会是随便发一篇水文来糊弄人的吧。】
【散了吧,估计是临时拼凑的材料,想敷衍白天的造假指控。】
【连个中文翻译都没有,这是心虚了吧。】
质疑的声音还在继续增加。
十几分钟后,引力社区的一位认证大V发文了。
他的认证头衔是“前百度深度学习实验室高级算法研究员”。
这位大V没有配图,而是直接发了一篇将近四千字的纯文本长文。
文章的开头只有干巴巴的一句话。
“别吵了,回响科技这次直接把AI界的桌子给掀了。”
这句话立刻吸引了数以十万计的流量。
大V在文章里使用了非常通俗的语言,对这篇论文的核心内容进行了拆解。
他解释了传统自然语言处理的痛点。
过去的算法依靠循环神经网络,处理文本必须按照词汇的先后顺序一个一个读取。
这种处理方式不仅计算速度慢,而且句子一旦过长,模型就会忘掉前面的设定。
这导致长文本生成经常出现前言不搭后语的问题。
大V在文章中加粗了一段文字。
“但这篇论文提出了一种全新的TranSfOrmer架构,他们直接抛弃了传统的循环和卷积网络。”
“他们提出了一种自注意力机制。”
“这种机制允许模型在处理一个词时,同时计算句子中所有其他词与它的关联度。”
“简单来说,它能在一眼之间看清整个句子的全局逻辑。”
“这解释了白天在展示现场,天问为什么能精准执行长达几百字、带有多重嵌套条件的复杂指令。”
文章发布后,相关的从业人士纷纷下场。
引力社区的热榜排名开始发生剧烈变化。
不少国内一线互联网大厂的算法工程师在评论区留言。
【我刚才照着论文里的公式手推了一遍,逻辑完全闭环,没有技术死角。】
【难怪生成速度那么快,这种架构天然支持矩阵运算,算力利用率是传统架构的好几倍。】
【作为同行,我必须承认,这是一篇能够改写教科书的开创性论文。】
【白天那些造谣后台有人工回复的博主呢?出来走两步?】
【这东西如果真能大规模跑通,现有的自然语言处理技术全得推倒重来。】
舆论的风向彻底逆转。
那些质疑造假的营销号集体陷入了沉默,许多账号开始连夜删除之前的黑稿。