新闻动态

逼近Claude!中国黑马27B模型与OpenAI同榜


新智元报道 就在上周,黄仁勋在高盛科技大会上说了一句让整个 AI 圈亢奋的话: 网络安全,很可能是 AI 的下一个杀手级应用。 几天前,OpenAI 刚刚官宣兑现了一年前的承诺——「自动化 AI 研究实习生」正式上岗,每 1 个人类研究员工作日的背后,已经有 3.1 个 Agent 工作日在跑。 巨头在抢跑,但最让人意外的事情发生在一张榜单上。 一支不到十个人的中国团队,把自己训练的 27B 模型送上了 CyberGym。 这是一个让 AI 在真实软件环境里复现漏洞的高难度评测,同榜的是 OpenAI、Anthropic、DeepSeek 这些名字。 这家公司叫万衍(Vera P raxis)。它研发的网络安全模型 Feyospace,在 CyberGym 的 Model-focused 纯模型能力对比中取得 63% 的成功率,逼近 Claude Sonnet 4.6 的 65.2%。此前,这类榜单的前列长期由 OpenAI、Anthropic 等巨头及其大模型占据;如今,一支不到十人的小团队凭借面向安全场景的专业化训练,进入了这场由巨头主导的竞争。 但比跑分更值得关注的,是他们想做的事: 把真实业务变成 AI 持续进化的引擎。做安全、做量化、做音频、做 App——每一块业务都不只是为了挣钱,而是要在经营过程中不断撞上模型还搞不定的问题,让专家帮模型补上这一课,然后让模型下次自己搞定。 业务跑得越远,模型学得越多;模型越强,业务就能挑战更难的事。 万衍赌的就是这个飞轮。 从 CyberGym 上的专业模型突破出发,万衍 Vera Praxis 正在构建一家以模型研发为核心、从真实经营中持续获得新能力的 AI 公司。 它瞄准的长期机会,是让业务增长与模型进步相互推动。 不到十人的团队 打开高难度专业智能的突破口 一支不到十人的安全研发团队,将自己的模型带上了汇集 OpenAI、Anthropic、DeepSeek 等机构模型的 CyberGym 榜单。 截至 2026 年 9 月 13 日,万衍的 Feyospace-v1 在该榜单上的漏洞复现成功率达到 63.0%,接近 Claude Sonnet 4.6 的 65.2%。 图 01 :Feyospace-v1 进入 CyberGym 榜单 官方 Model-focused 榜单局部,Feyospace-v1 成功率为 63.0%。所示条目于 2026 年 9 月 14 日核验。成绩由各团队自行评测提交,各条目的运行框架见图。

about image