ESC
开源 2 分钟阅读

Laya:Jev 的开源版本

Laya 是完全开源的 System 1 决策模型家族,基于双向编码器构建,单 GPU 推理仅需 32.8 毫秒,比 TypeSafe AI 的闭源模型 Jev 快 6-8 倍,支持 100+ 语言,权重以 Apache 2.0 协议开源,并内置 Router 跨 22 种文字系统自动分流模型,解决多语言场景下置信度失真问题。

来源:Hacker News

随后在2026年9月,一家资金雄厚的尖端实验室 TypeSafe AI(由 OpenAI ChatGPT 联合发明人 Diogo Almeida 创立)发布了 Jev。他们把完全相同的非自回归决策概念包装成全新的科学突破,但发布时既没有技术论文,也没有开放权重,更没有任何开放的训练数据集。

我此前的模型使用 PPO 对序列表示进行训练,在垂直销售对话中输出逐轮转化轨迹(0.0 到 1.0 的概率)。Jev 则通过他们所谓的 RLCD(Reinforcement Learning for Calibrated Decisions,校准决策强化学习)将并行采样加以泛化,横向输出置信度分布和 schema 选择,按每百万输入 token 收取 0.042 美元,典型响应时间约 150 毫秒。

我没有一直耿耿于怀,而是决定把学到的一切拿来,修正旧方案的所有架构局限,构建一个完全开放的横向 System 1 决策模型家族:Laya。

由于我们在双向编码器上进行了正确的构建,我们的模型在单块 GPU 上运行仅需 32.8 毫秒(批处理时每问题 7.2 毫秒),比 Jev 快 6 到 8 倍,完整支持超过 100 种语言,零 API 订阅费用,权重 100% 以 Apache 2.0 协议开源。

每个现代 AI 流水线都有一个巨大瓶颈:我们在用生成式 LLM 处理简单的反射式决策。

当客服工单到达、邮件进入收件箱,或用户向你的 API 提交提示词时,你通常只需要回答简单的结构化问题:

为此调用 8B、70B 乃至前沿生成式 LLM 完全是大材小用。你要等 500 到 2000 毫秒让 token 流式输出,为推理花真金白银,然后还得写正则表达式或 JSON 解析器从自由文本中提取干净的标签。最糟的是,LLM 极易产生幻觉并生成虚假的置信度。当 LLM 输出 “confidence: 0.95” 时,它只是在预测听起来自信的 token,背后没有任何数学校准。

我们需要一个像人类大脑 System 1 一样工作的模型:即时反射式决策,给出诚实、经过校准的概率,在标准通用硬件上只需 30 到 35 毫秒。

Laya 通过单次前向传播即可对任意状态(原始文本、邮件、工单或 JSON 文档)评估类型化问题。它依赖三个原语:

由于输出空间纯粹由概率和数字组成,模型永远不会生成文本,不可能产生幻觉,schema 违规或格式错误的 JSON 在物理上不可能出现。

单一模型不可能在所有任务和语言上都达到最优。我们发布了三个专用 checkpoint,现已整合到 Hugging Face 上的单一仓库中心:

为了不让用户被迫管理三个独立仓库或下载共 2.5 GB 的权重,主仓库 convaiinnovations/laya 打包了全部三个模型。借助 Hugging Face 的 allow_patterns,Laya 的 SDK 只下载所需的特定子文件夹:

下载英语模型(约 808 MB)

agent_en = laya.load(“convaiinnovations/laya”)

只下载多语言子文件夹(约 647 MB),而非整个 2.5 GB 包

agent_ml = laya.load(“convaiinnovations/laya”, subfolder=“multilingual”)

4. 为什么路由至关重要:多文字系统的现实

我们在 MASSIVE 基准(20 个选项,随机基线 = 0.050)上对 51 种语言进行全面测试时,最令人大开眼界的发现之一是英语模型在拉丁字母之外的表现有多糟糕。

ModernBERT-large 拥有 5 万 token 的英语 BPE 词表,处理非拉丁字母时简直一塌糊涂:

这是关键的教训:当模型读不懂输入的文字系统时,它自身的置信度不会发出任何警告。在 51 种语言中,英语 checkpoint 的平均置信度从未低于 0.885,无论其准确率是 82% 还是 0%。

因此,置信度门控无法保护你。必须在前向传播之前决定使用哪个模型。

Laya 内置了 Router,可检查输入文本的 Unicode 文字系统,覆盖 22 种字母体系(天城文、CJK 汉字、西里尔字母、阿拉伯字母、希伯来字母、泰米尔字母、泰文字母等),并分析拉丁语停用词分布:

与 33 毫秒的前向传播相比,路由开销可以忽略不计(<2%)。使用 Router(preload=True) 时,所有需要的模型常驻 VRAM/RAM,彻底消除了流量在语言之间交替时 7 到 10 秒的冷切换惩罚。

from laya import Router

预加载 checkpoint 到内存,实现 35 毫秒以内的即时路由

router = Router(preload=True)

英语 -> 自动路由到 ModernBERT-large

res_en = router.predict({“body”: “I was charged twice, please refund.”}, questions)

印地语 -> 自动路由到 mmBERT-base(支持 100+ 语言)

res_hi = router.predict({“body”: “मुझसे दो बार शुल्क लिया गया, कृपया पैसे वापस करें।”}, questions)

已知领域时可显式覆盖

res_spec = router.predict(state, questions, model=“typed-decisions”)

5. 正面对比:Laya(含路由)与 TypeSafe Jev

我们在公开数据集和标准基准上将 Laya 与 TypeSafe Jev 进行了直接对比测试。Laya 的所有数字均为实测;Jev 的数字来自第三方独立研究(AbdelStark、nibzard)以及 TypeSafe AI 的公开数据。