跳到主要内容
Apache 2.0 · 100+ 语言

Laya AI:一次推理,输出校准决策

面向文本、邮件、工单和 JSON。用结构化问题获取校准概率,不生成自由文本。

文本邮件工单JSON

为输入判断而设计,不靠长文生成

输入内容和可选答案在这里被清楚分开。你在请求时定义问题和选项,模型用一次前向传播完成打分,并返回可用于阈值判断、日志记录、复现实验和事后审计的概率分布。

英文根模型基于 ModernBERT-large,共有 4.21 亿参数,处理英文判断时支持 512 个 token 上下文。

多语言模型基于 mmBERT-base,共有 3.22 亿参数,支持超过 100 种语言,默认上下文为 1,024 个 token,编码器最高可支持 8,192。

训练采用 RLCD,并以严格适当评分规则作为奖励信号,鼓励模型如实报告不确定性。

模型家族包含英文根模型、多语言模型和类型化决策模型,全部以 Apache 2.0 开放权重发布。

在公开评测中,校准后的模型在 2,691 个邮件分诊问题上达到 0.732 准确率,在事实核查上达到 0.883,在意图与路由上达到 0.991,在审核与安全上达到 0.967。

面向真实业务场景的能力

Laya AI 适合分类、路由、评分、审核、护栏和决策工作流。这些场景需要可解释、可比较、可追溯的概率结果,而不是一段看起来流畅却无法直接执行的生成文本。

结构化答案

给出选择题、评分题或是否题后,返回的是结构化决策,而不是一段自由文本。答案范围在请求时定义,新增模式不需要重新训练编码器。

一次推理完成多项判断

一次请求中的所有问题都在同一次前向传播里回答。紧急度、负责部门、退款意图和流失风险等并行检查可以合并处理。

自动路由

内置 Router 会先识别语言和书写系统,再在英文与多语言模型之间分发请求。常用模型可以常驻内存,也支持显式指定语言。

校准后的概率

输出包含概率分布,便于把置信度接入人工复核、抽样检查或升级流程。文档建议先用自己的数据拟合 temperature,再在生产阈值中信任这些置信度。

不生成自由文本

因为没有开放式的文本生成过程,团队不必解析自由回复,也能减少一类常见幻觉。输出始终对应请求中给出的选项,并保留可用于升级处理的置信度。

从输入内容到可执行决策

接入路径很短:安装软件包,定义输入和答案范围,调用 Router 或已加载的 agent,再根据返回的概率执行业务动作。

安装软件包

从 PyPI 安装 laya 包,只加载服务实际需要的模型。模型家族位于 Hugging Face 的 convaiinnovations/laya 仓库。

准备输入内容

提供邮件、工单、文档、JSON 数据或其他文本输入。输入本身保持简洁,把判断规则放进问题指令和选项说明。

定义结构化问题

可以把部门选择题、紧急度评分题和“是否要求退款”放进同一次调用,所有问题会一起得到答案。

路由并执行动作

读取选中的选项和概率,记录路由元数据,再应用自己的阈值。遇到暂不支持的书写系统时,Router 会选择多语言模型。

上线前完成评估

标注一部分真实输入,把新结果与现行决策规则比较,按问题类型和选项数量检查错误,再拟合 temperature,并依据证据设定升级阈值。

实测结果与已知限制

以下数字来自 Laya 项目文档。每项结果都标注了测量所用的模型、工作负载和硬件。

0.766 类型化决策准确率

来自微调模型在 2,000 个决策上的结果。

0.753 任务内准确率

覆盖 24,314 个评测问题。

0.947 50% 覆盖率准确率

基于公开评测的校准结果。

38.4 ms 单问题 p50 延迟

来自项目本地评测记录。

测量条件

相关结果会标注测量所用的模型、工作负载和硬件。

已知权衡

基础模型在类型化决策零样本评测中接近随机水平;序数评分是最弱的基本能力;Banking77 的 77 个选项在默认 token 预算下会降到 0.425。

校准证据

在公开的 24,314 个任务内问题上,总体准确率为 0.753,ECE 为 0.030,Brier 分数为 0.308,50% 覆盖率下准确率为 0.947。情感与评分仍是最弱的任务族,为 0.442。

Laya AI 与 TypeSafe Jev 对比

下面是更紧凑的公开数据对比。

指标 TypeSafe Jev 1.13.0 Laya AI(路由模式)
类型化决策,2,000 条 0.727 0.766
AG News,4 分类 0.910 0.950
DAIR Emotion,6 分类 0.480 0.595
Banking77,72 对 77 类 0.870 0.425
ECE,越低越好 0.246 0.081
单问题 p50 延迟 236–276 ms 32.8 ms
可用语言 无公开基准 51 种中的 45 种
权重 闭源 API Apache 2.0

TypeSafe Jev 数据来自其公开文档;两者的基准样本规模和提示词不同。

高选项与软分布结果

  • Banking77:TypeSafe Jev 0.870;Laya AI 在 77 个选项问题上为 0.425。
  • 类型化决策软准确率:TypeSafe Jev 0.580;Laya AI 0.471。
  • 原始 ECE:TypeSafe Jev 0.144;Laya AI 温度拟合前为 0.213,领域温度拟合后为 0.081。

在自己的环境自托管开放权重

模型采用 Apache 2.0 许可,并提供文档完善的服务启动方式。权重、请求、日志和阈值策略都可以保留在你自己的环境内。

安装并启动服务

安装带有 serve 扩展的 laya 包后运行 laya-serve。环境变量可选择 GPU 或 CPU 部署设备,并控制预热行为。

兼容 Jev 的端点

服务提供 POST /v1/systemone 接口,请求和响应结构沿用 TypeSafe Jev 的约定。现有客户端只需要更改 base URL,不需要修改载荷契约。

控制访问权限

服务默认绑定 0.0.0.0 且不启用认证。如果要暴露到私有网络之外,请设置 LAYA_API_KEY,要求请求携带 Authorization bearer token。

在适用范围内运营

英文输入使用英文根模型,非英文输入交给多语言模型;持续关注选项长度,并把模型用于确实需要校准分数而非自由文本生成的决策。

语言路由与覆盖范围

模型能力和路由证据分别记录:多语言模型支持超过 100 种语言,共享基准测量了 51 种语言,其中 45 种超过随机基线三倍。以下行为来自项目文档。

  • 英文输入使用基于 ModernBERT-large 的英文根模型。
  • 非拉丁文字会路由到多语言模型。
  • Router 的文字系统识别耗时低于 0.5 毫秒。
  • 共享基准测得 51 种语言中的 45 种可用。
  • 多语言模型支持超过 100 种语言。
  • 0.3.7 改进了仅使用 ASCII 字母的罗曼语系文本处理。
  • 巴西葡萄牙语支持也在 0.3.7 中得到改进。
  • 语言检测可以通过 lang_guess 参数替换。
  • Router 默认最多预加载两个模型。
  • 单语言部署不会加载第二个模型。

常见问题

Laya AI 是什么?

Laya AI 是一族非自回归决策模型。它读取输入内容和结构化问题,返回结构化答案与概率分布,而不是生成自由文本。

有哪些可用模型?

模型仓库包含 4.21 亿参数的英文根模型、3.22 亿参数的多语言模型,以及 4.21 亿参数的类型化决策模型。每个模型都有对应的编码器、上下文长度和适用的工作负载。

它能取代会写回复的语言模型吗?

不能。它是 System 1 决策模型,适合选择、评分、路由、护栏、审核和置信度信号。如果产品确实需要生成回复,应交给另一个组件处理。

如何安全使用概率?

先用自己的数据拟合 temperature,检查校准曲线,再设置保守阈值。公开评测显示,校准后的任务内总体准确率为 0.753,50% 覆盖率下为 0.947。

选项很多时表现如何?

选项数量会影响 token 预算。文档建议在约 50 个或更多选项时提高 head_max_len,或把大型选项集拆成从粗到细的层级结构。

零样本能力有什么限制?

基础模型在类型化决策基准的零样本设置下接近随机水平。0.766 来自专门微调过的模型,因此部署前必须评估自己的工作负载。

可以商业自托管吗?

模型采用 Apache 2.0 许可,项目文档也说明了商业用途。请通过你自己的合规流程复核许可证,并在服务不处于私有网络时启用认证。

模型来自哪里?

它由 Convai Innovations 发布在 Hugging Face。项目文档还链接了 GitHub、PyPI、在线演示、评测报告和微调 Notebook 等资源。

公开评测覆盖了什么?

RL-agent 评测覆盖任务内任务族、留出的零样本任务族、校准和延迟。零样本总体准确率为 0.651;更大的任务内集合报告 0.753。

本地评测中的速度如何?

本地评测记录了 1 个问题的 p50 延迟为 38.4 毫秒,10 个问题为 156.0 毫秒,50 个问题为 721.4 毫秒;对应的 p95 数值也已发布。