返回目录
关灯 护眼
加入书架

第421章 未央(2 / 2)

最开始,没人把这个数字当真。

跑分榜上闹乌龙,又不是头一回的事。

多半是哪个新模型钻了题库的空子,要不就是评测脚本出了岔子,再不然,就是有人在背后刷榜……

技术论坛里清一色全是这类的猜测。

于是有好事者,拿着公开的那部分题目,自己动手复了一遍盘。

结果这个数据居然是真的!

紧接着,又有人在另外几张榜单上,看见了未央这个名字。

putnabench,那六百七十二道用lean形式化写就的普特南竞赛题,排在最前面的,从来都是那几个烧钱烧到上千美元一道题的家伙。

而未央挂上去的成绩,是六百七十二道,全解。

一道不落,且每一道题后面,都有一份机器当场就能验过的完整证明。

然后在大家吃惊的时候……

if2f上的四百多道奥赛级的形式化题目,也被它清了个干干净净。

这两张榜,向来是机器证明这一脉的试金石。

它们的题目虽是公开的,证明却必须一步一步由机器亲自验过,才算数。

在这种地方,你糊弄不了任何人,蒙也蒙不过去。

所以消息很快就在ai圈和数学圈里,一同传开了。

谁也不知道这“未央”是打哪儿冒出来的,更想不通它凭什么能在这几张榜上,把所有人都甩出这么远。

不过这种公开的跑分的大模型到底是哪家的总是有办法查到的。

所以很快就有人把它给扒了出来……这模型出自燕大。

燕大?

要知道,上一个从华夏的大学里走出来还在国际上闯出过名号的大模型,还是智谱。

可如今这个未央看起来好像比智谱还要凶的样子。

不过很快就有眼尖的人注意到,未央并非张张榜单都拔尖。

在那张衡量综合智力的artifialysis指数上,在比拼对话偏好的chatbotarena上,在考较编程的swe-bench、考较多模态的那一类项目里,这个未央要么名次平平,要么干脆连个影子都找不着。

很显然,这压根就不是一个什么都会的通用大模型。

它更像是一个专为数学而生的大模型。

所以很快所有人都第一时间跑去燕大的官网,想看看燕大有没有什么消息。

果然……

燕大的官网上面一条置顶通知出现在了大家面前。

【关于“未央”数学大模型开放公测的通知】

【各位同仁、各界朋友:】

【“未央”,是一款面向数学研究的专用大模型,为“aiforath”而生。】

【不同于以拟合见长的通用模型,未央以精确的符号推理为根基,所给出的结论,均附有可由机器逐步核验的证明,它擅长在庞大的符号与数据空间中做有引导的检索,擅长大规模恒等式的精确验证,也可以作为定理形式化与证明书写的可靠助手。】

【我们希望,它能成为数学工作者手边一件趁手的工具,替诸位分担那些繁重而严苛、半点差错都容不得的演算。】

【现开放公测,诚邀各界前来体验。】

【燕京大学项目顾问:田刚高文稳姚先生等】

这则通知ai圈自然是被震动了,因为“以精确的符号推理为根基”他们根本没听过呀,这时啥?

就在他们懵逼的时候,数学圈的反应就更大了。

“aiforath”这个说法,数学家们其实并不陌生。

前些年也不是没出现过打着这旗号的模型,可那些东西,大多只能做做最初等的活,真到了深处,那保准出错。

所以一直以来,数学家们对ai的态度,都拧巴得很,想用,却又不太敢信。

毕竟,把自己几年的心血,押在一个张口就可能胡说八道的东西上,谁也没那个胆子。