英文根模型基于 ModernBERT-large,共有 4.21 亿参数,处理英文判断时支持 512 个 token 上下文。
Laya AI:一次推理,输出校准决策
面向文本、邮件、工单和 JSON。用结构化问题获取校准概率,不生成自由文本。
为输入判断而设计,不靠长文生成
输入内容和可选答案在这里被清楚分开。你在请求时定义问题和选项,模型用一次前向传播完成打分,并返回可用于阈值判断、日志记录、复现实验和事后审计的概率分布。
多语言模型基于 mmBERT-base,共有 3.22 亿参数,支持超过 100 种语言,默认上下文为 1,024 个 token,编码器最高可支持 8,192。
训练采用 RLCD,并以严格适当评分规则作为奖励信号,鼓励模型如实报告不确定性。
模型家族包含英文根模型、多语言模型和类型化决策模型,全部以 Apache 2.0 开放权重发布。
在公开评测中,校准后的模型在 2,691 个邮件分诊问题上达到 0.732 准确率,在事实核查上达到 0.883,在意图与路由上达到 0.991,在审核与安全上达到 0.967。
面向真实业务场景的能力
Laya AI 适合分类、路由、评分、审核、护栏和决策工作流。这些场景需要可解释、可比较、可追溯的概率结果,而不是一段看起来流畅却无法直接执行的生成文本。
结构化答案
给出选择题、评分题或是否题后,返回的是结构化决策,而不是一段自由文本。答案范围在请求时定义,新增模式不需要重新训练编码器。
一次推理完成多项判断
一次请求中的所有问题都在同一次前向传播里回答。紧急度、负责部门、退款意图和流失风险等并行检查可以合并处理。
自动路由
内置 Router 会先识别语言和书写系统,再在英文与多语言模型之间分发请求。常用模型可以常驻内存,也支持显式指定语言。
校准后的概率
输出包含概率分布,便于把置信度接入人工复核、抽样检查或升级流程。文档建议先用自己的数据拟合 temperature,再在生产阈值中信任这些置信度。
不生成自由文本
因为没有开放式的文本生成过程,团队不必解析自由回复,也能减少一类常见幻觉。输出始终对应请求中给出的选项,并保留可用于升级处理的置信度。
从输入内容到可执行决策
接入路径很短:安装软件包,定义输入和答案范围,调用 Router 或已加载的 agent,再根据返回的概率执行业务动作。
安装软件包
从 PyPI 安装 laya 包,只加载服务实际需要的模型。模型家族位于 Hugging Face 的 convaiinnovations/laya 仓库。
准备输入内容
提供邮件、工单、文档、JSON 数据或其他文本输入。输入本身保持简洁,把判断规则放进问题指令和选项说明。
定义结构化问题
可以把部门选择题、紧急度评分题和“是否要求退款”放进同一次调用,所有问题会一起得到答案。
路由并执行动作
读取选中的选项和概率,记录路由元数据,再应用自己的阈值。遇到暂不支持的书写系统时,Router 会选择多语言模型。
上线前完成评估
标注一部分真实输入,把新结果与现行决策规则比较,按问题类型和选项数量检查错误,再拟合 temperature,并依据证据设定升级阈值。
实测结果与已知限制
以下数字来自 Laya 项目文档。每项结果都标注了测量所用的模型、工作负载和硬件。
来自微调模型在 2,000 个决策上的结果。
覆盖 24,314 个评测问题。
基于公开评测的校准结果。
来自项目本地评测记录。
测量条件
相关结果会标注测量所用的模型、工作负载和硬件。
已知权衡
基础模型在类型化决策零样本评测中接近随机水平;序数评分是最弱的基本能力;Banking77 的 77 个选项在默认 token 预算下会降到 0.425。
校准证据
在公开的 24,314 个任务内问题上,总体准确率为 0.753,ECE 为 0.030,Brier 分数为 0.308,50% 覆盖率下准确率为 0.947。情感与评分仍是最弱的任务族,为 0.442。
Laya AI 与 TypeSafe Jev 对比
下面是更紧凑的公开数据对比。
| 指标 | TypeSafe Jev 1.13.0 | Laya AI(路由模式) |
|---|---|---|
| 类型化决策,2,000 条 | 0.727 | 0.766 |
| AG News,4 分类 | 0.910 | 0.950 |
| DAIR Emotion,6 分类 | 0.480 | 0.595 |
| Banking77,72 对 77 类 | 0.870 | 0.425 |
| ECE,越低越好 | 0.246 | 0.081 |
| 单问题 p50 延迟 | 236–276 ms | 32.8 ms |
| 可用语言 | 无公开基准 | 51 种中的 45 种 |
| 权重 | 闭源 API | Apache 2.0 |
TypeSafe Jev 数据来自其公开文档;两者的基准样本规模和提示词不同。
高选项与软分布结果
- Banking77:TypeSafe Jev 0.870;Laya AI 在 77 个选项问题上为 0.425。
- 类型化决策软准确率:TypeSafe Jev 0.580;Laya AI 0.471。
- 原始 ECE:TypeSafe Jev 0.144;Laya AI 温度拟合前为 0.213,领域温度拟合后为 0.081。
在自己的环境自托管开放权重
模型采用 Apache 2.0 许可,并提供文档完善的服务启动方式。权重、请求、日志和阈值策略都可以保留在你自己的环境内。
安装并启动服务
安装带有 serve 扩展的 laya 包后运行 laya-serve。环境变量可选择 GPU 或 CPU 部署设备,并控制预热行为。
兼容 Jev 的端点
服务提供 POST /v1/systemone 接口,请求和响应结构沿用 TypeSafe Jev 的约定。现有客户端只需要更改 base URL,不需要修改载荷契约。
控制访问权限
服务默认绑定 0.0.0.0 且不启用认证。如果要暴露到私有网络之外,请设置 LAYA_API_KEY,要求请求携带 Authorization bearer token。
在适用范围内运营
英文输入使用英文根模型,非英文输入交给多语言模型;持续关注选项长度,并把模型用于确实需要校准分数而非自由文本生成的决策。
语言路由与覆盖范围
模型能力和路由证据分别记录:多语言模型支持超过 100 种语言,共享基准测量了 51 种语言,其中 45 种超过随机基线三倍。以下行为来自项目文档。
- 英文输入使用基于 ModernBERT-large 的英文根模型。
- 非拉丁文字会路由到多语言模型。
- Router 的文字系统识别耗时低于 0.5 毫秒。
- 共享基准测得 51 种语言中的 45 种可用。
- 多语言模型支持超过 100 种语言。
- 0.3.7 改进了仅使用 ASCII 字母的罗曼语系文本处理。
- 巴西葡萄牙语支持也在 0.3.7 中得到改进。
- 语言检测可以通过 lang_guess 参数替换。
- Router 默认最多预加载两个模型。
- 单语言部署不会加载第二个模型。
常见问题
Laya AI 是什么?
Laya AI 是一族非自回归决策模型。它读取输入内容和结构化问题,返回结构化答案与概率分布,而不是生成自由文本。
有哪些可用模型?
模型仓库包含 4.21 亿参数的英文根模型、3.22 亿参数的多语言模型,以及 4.21 亿参数的类型化决策模型。每个模型都有对应的编码器、上下文长度和适用的工作负载。
它能取代会写回复的语言模型吗?
不能。它是 System 1 决策模型,适合选择、评分、路由、护栏、审核和置信度信号。如果产品确实需要生成回复,应交给另一个组件处理。
如何安全使用概率?
先用自己的数据拟合 temperature,检查校准曲线,再设置保守阈值。公开评测显示,校准后的任务内总体准确率为 0.753,50% 覆盖率下为 0.947。
选项很多时表现如何?
选项数量会影响 token 预算。文档建议在约 50 个或更多选项时提高 head_max_len,或把大型选项集拆成从粗到细的层级结构。
零样本能力有什么限制?
基础模型在类型化决策基准的零样本设置下接近随机水平。0.766 来自专门微调过的模型,因此部署前必须评估自己的工作负载。
可以商业自托管吗?
模型采用 Apache 2.0 许可,项目文档也说明了商业用途。请通过你自己的合规流程复核许可证,并在服务不处于私有网络时启用认证。
模型来自哪里?
它由 Convai Innovations 发布在 Hugging Face。项目文档还链接了 GitHub、PyPI、在线演示、评测报告和微调 Notebook 等资源。
公开评测覆盖了什么?
RL-agent 评测覆盖任务内任务族、留出的零样本任务族、校准和延迟。零样本总体准确率为 0.651;更大的任务内集合报告 0.753。
本地评测中的速度如何?
本地评测记录了 1 个问题的 p50 延迟为 38.4 毫秒,10 个问题为 156.0 毫秒,50 个问题为 721.4 毫秒;对应的 p95 数值也已发布。