返回模型列表

Laya – 开源的非自回归 AI 决策模型,Jev 开源平替

AI科技编辑部
RSS 订阅

导读摘要:

Laya 是一个基于双向编码器架构的开源非自回归 AI 决策模型,由 ConvAI Innovations 团队研发。与主流大语言模型不同,Laya 不进行文本生成,而是基于 ModernBERT/mmBERT 双向编码器,对一段输入状态加一组类型化问题仅执行一次前向传播,约 33ms 即可输出结构化决策结果与校准概率。模型内置语言路由机制,支持 100+ 语言的自动识别与分发。相比闭源模型 Je...

1. Laya是什么

Laya 是一个基于双向编码器架构的开源非自回归 AI 决策模型,由 ConvAI Innovations 团队研发。与主流大语言模型不同,Laya 不进行文本生成,而是基于 ModernBERT/mmBERT 双向编码器,对一段输入状态加一组类型化问题仅执行一次前向传播,约 33ms 即可输出结构化决策结果与校准概率。模型内置语言路由机制,支持 100+ 语言的自动识别与分发。相比闭源模型 Jev,Laya 在准确率(76.6% vs 72.7%)、多语言支持(100+ 语言)和成本(本地部署免费)上具备明显优势,为结构化决策任务提供了一种高效、可控且完全开源的替代方案。

技术定位与领域: Laya 属于自然语言处理领域中的结构化决策模型,专注于分类、打分和是非判断等任务。其独特之处在于彻底放弃自回归文本生成范式,转而采用双向编码器加类型化输出的架构,在特定任务上实现了数量级的推理速度提升。

研发背景: 该模型由 ConvAI Innovations 团队开发,其研发动机直指现有大模型在结构化决策场景中的两大痛点——推理延迟过高和置信度不可靠。团队选择 ModernBERT-large 和 mmBERT-base 作为骨干网络,配合 RLCD 强化学习训练方法,试图构建一个专为决策任务优化的专用模型。

核心价值: Laya 解决了传统大模型在需要快速、可校准、可解释决策场景下的效率与可信度问题。其置信度经过严格真评分规则训练具有统计意义,可直接驱动自动放行/人工复核的业务流程,这一特性在金融风控、内容审核、智能客服等场景中具有实际业务价值。

技术特点: Laya 采用双向非自回归架构,为每个候选选项分配独立 [MASK] 位,一次前向输出所有选项的概率分布;通过 RLCD 严格真评分规则训练,模型只有在输出真实后验概率时才能获得高分,从根本上规避了传统大模型"盲目自信"的问题。

2. 主要功能

  • 单次前向决策: 输入一段状态文本加一组类型化问题,模型仅需一次前向传播即可直接返回结构化结果,完全不做文本生成。实测在 T4 GPU 上单次推理约 33ms,批量场景下可低至 7.2ms/题,比闭源竞品 Jev 快约 7.8 倍,为高并发实时决策场景提供了技术基础。

  • 三种决策原语: 模型内置 choice、score、noul 三种基础决策类型。choice 从候选项中选出一个并给出各项概率;score 在有序量表上打分并输出分布;noul 回答是非问题并返回 0–1 的成立概率。三种原语覆盖了分类、打分、是非判断绝大多数结构化决策场景,且可自由组合。

  • 语言自动路由: 内置 Router 组件在推理前用纯 Python 检测输入文本的 Unicode 字符集与语言,耗时小于 0.5ms,自动将请求分发到英文或多语言 checkpoint。这一机制解决了英文模型在非拉丁文字上会以 0.95 置信度给出 0 准确率答案的"自信地答错"问题。

  • 置信度门控: 模型输出的概率经 RLCD 训练具备统计意义,用户可设定置信度阈值(如 0.85),高置信决策自动放行,低置信结果转人工处理。这一功能使 Laya 能够嵌入自动化业务流程,在保证准确率的同时控制人工成本。

  • 内置工作流预设: 提供模型路由、提示注入防护、内容安全审核、工单分诊等预置问题模板,覆盖 Agent 系统入口防护、UGC 平台内容审核等高频场景,用户无需从零设计问题模板,开箱即用。

  • 本地微调能力: 附带 Kaggle notebook,支持用自有数据完成造数据、RLCD 训练、温度拟合、评测的完整微调流程。用户可根据自身业务数据对模型进行定制化训练,温度拟合后平均 ECE 可从 0.466 降至 0.081。

3. 如何使用

  1. 安装环境: 执行 pip install laya 安装 PyPI 包。需注意该包仍处于快速迭代阶段,版本号在两天内从 0.1.0 更到 0.3.4,接口可能存在变动,建议锁定版本号使用。推荐使用 Python 3.9+ 环境,GPU 推理建议使用 T4 及以上型号。

  2. 加载模型: 使用 Router(preload=True) 预加载三个 checkpoint(英文、多语言及路由模型),避免冷启动时每次切换语言都重建模型。预加载会增加初始内存占用,但能显著降低首次推理延迟。

  3. 准备状态输入: 将待分析的文本组装成字典结构,例如 {"from": ..., "subject": ..., "body": ...}。该结构支持任意语言或 JSON 嵌套格式,用户可根据业务场景自由定义字段。

  4. 定义类型化问题: 用 JSON 格式编写一组问题,需指定 type(choice / score / noul)、instructions 和 criteria(选项列表或量表范围)。例如分类问题需给出候选选项,打分问题需定义量表上下界。

  5. 执行预测: 调用 router.predict(state, questions) 进行推理,一次前向传播返回所有问题的答案。英文输入自动走 laya checkpoint,Hindi 等非拉丁语言自动分发到 multilingual checkpoint,路由决策在推理前完成。

  6. 读取与门控: 从 res["answers"] 中提取 choice 标签、score 分值或 noul 概率,res["routing"] 字段解释为何选择该 checkpoint。对 confidence 设置阈值(如 0.85)实现高置信自动处理、低置信转人工的流程——但前提是先在自己的数据上完成温度拟合。

4. 优缺点分析

优点
极速推理性能: 单次前向传播约 33ms(T4 GPU),批量场景低至 7.2ms/题,比闭源竞品 Jev 快约 7.8 倍,适合对延迟敏感的高并发决策场景。
零幻觉风险: 模型不生成自由文本、只输出结构化决策结果,不存在编造内容的可能,也没有文本解析负担,在需要严格输出格式的生产环境中具有天然优势。
概率可校准: 经 RLCD 严格真评分规则训练,置信度具有统计意义,温度拟合后平均 ECE 仅 0.081,显著优于 Jev 的 0.246,可直接驱动自动放行/人工复核流程。
完全开源零成本: 采用 Apache-2.0 协议,权重完全开放,支持自托管部署。对比 Jev 的 $0.042/百万 token API 费用,长期使用成本为零,数据可完全本地处理不出境。

5. 同类工具对比

维度 Laya(开源)
协议/权重 Apache-2.0,权重完全开放,可自托管
延迟(单题) 32.8 ms(T4 实测)
typed-decisions 准确率 0.766(微调版)
ECE 校准误差 0.081(温度拟合后)
Banking77 高基数分类 0.425(77 选项,弱)
语言覆盖 100+ 语言,Router 自动分发
成本 自托管 $0
数据隐私 可完全本地运行,数据不出境
软分布匹配(soft acc) 0.471
开箱即用性 基础模型零样本接近随机,需微调

从对比可见,Laya 与 Jev 各有侧重。在延迟敏感、数据隐私要求高、需要多语言支持且预算有限的场景中,Laya 凭借 33ms 级推理速度和零部署成本占据明显优势。但在高基数分类任务(如 70+ 选项的意图识别)和需要精确匹配教师分布的场景中,Jev 的成熟度和稳定性更胜一筹。

选型建议方面,如果业务场景以二分类、低基数分类、打分排序为主,且对推理延迟和数据隐私有严格要求,Laya 是更经济高效的选择;如果任务涉及大量细粒度类别区分(如 70+ 类别的工单分类),或团队缺乏微调能力,建议优先考虑 Jev 的商业 API 服务。

6. 编辑总结

Laya 在技术路径上做出了明确取舍:放弃通用文本生成能力,专注于结构化决策这一细分场景。这种"少即是多"的设计哲学带来了两个直接收益——33ms 级的推理速度和具有统计意义的置信度输出。前者得益于双向编码器一次前向传播即可输出所有选项概率的架构设计,后者则源于 RLCD 严格真评分规则的训练方法,这两项技术选择构成了 Laya 的核心竞争力。

从实用价值来看,Laya 的置信度门控机制为自动化决策流程提供了可靠的技术支撑。在温度拟合后 ECE 降至 0.081 的前提下,概率输出可以直接驱动业务规则引擎,实现高置信自动处理、低置信人工介入的闭环。这一能力在客服工单分诊、内容安全审核、Agent 防护等场景中具有直接的生产价值。

Laya 的适用人群主要包括:需要低延迟决策能力的后端工程师、关注数据隐私的企业开发者、希望降低推理成本的中小团队,以及需要多语言支持的国际业务开发者。Apache-2.0 协议和完整的微调工具链降低了使用门槛,但基础模型零样本性能偏弱的特点要求使用者具备一定的微调能力。

从发展潜力来看,Laya 所代表的"专用小模型+严格概率训练"路线为 AI 决策场景提供了大模型之外的另一选择。随着 RLCD 训练方法的成熟和社区生态的积累,这类模型有望在更多垂直场景中落地。不过,高基数分类能力的短板和接口稳定性问题仍需持续改进,这也是开源项目从原型走向生产环境必须跨越的门槛。

7. 应用场景

  • 客服工单自动分诊: 在客服系统中,Laya 可判断工单所属部门(billing/technical/sales)、紧急程度、用户挫败感和流失风险。高置信工单自动派单至对应部门,低置信工单转人工处理,在 33ms 级延迟下实现实时分诊,显著降低客服团队的响应时间。

  • 内容安全与审核: 社区和 UGC 平台可利用 Laya 的 noul 原语检测毒性、骚扰、威胁内容,直接输出违规概率。审核系统可设定阈值,对概率超过 0.9 的内容自动拦截,对临界内容转人工复核,兼顾审核效率与准确率。

  • 提示注入防护(Guardrails): 在 Agent 系统入口部署 Laya,检测越狱、注入、密钥泄露等攻击行为。33ms 级的推理延迟使其可以嵌入每次请求链路而不影响用户体验,为 LLM 应用提供前置安全防护层。

  • 智能模型路由: 在混合大模型架构中,Laya 可判断请求应路由到小模型还是前沿大模型。通过极低成本的调度决策,在保证回答质量的前提下将简单请求分流至小模型处理,有效降低整体推理费用。

8. 常见问题FAQ

Q:Laya 和传统大语言模型(如 GPT、Llama)的本质区别是什么?
A:Laya 不进行文本生成,而是基于双向编码器对输入做一次前向传播,直接输出结构化决策结果。传统 LLM 逐 token 生成文本,延迟高且存在幻觉风险;Laya 为每个候选选项分配独立 [MASK] 位,一次前向输出所有选项的概率分布,因此速度更快、输出格式更可控。

Q:Laya 的置信度为什么可以直接用于自动化决策?
A:Laya 采用 RLCD 强化学习训练,以对数评分、球面评分、等级概率评分等严格真评分规则作为奖励。模型只有在输出真实后验概率时才能获得高分,不确定时置信度自然降低。经过温度拟合后平均 ECE 可降至 0.081,此时概率具有统计意义,可直接驱动自动放行/人工复核流程。

Q:为什么需要温度拟合?出厂模型不能直接用吗?
A:出厂 checkpoint 存在过度自信问题,概率分布偏尖锐。需要按(问题类型、选项数)在自有数据上拟合温度参数,对概率进行校准。拟合后平均 ECE 可从 0.466 降至 0.081,未校准的概率直接用于阈值判断可能导致大量误判。

Q:Laya 在非拉丁语言上的表现如何?为什么需要语言路由?
A:英文 checkpoint 在非拉丁文字上会以 0.95 置信度给出 0 准确率的答案,且置信度本身无法预警。因此 Laya 内置 Router 在推理前检测输入脚本与语言,自动分发到英文或多语言 checkpoint。Router 支持 100+ 语言,检测耗时小于 0.5ms。

Q:Laya 适合处理高基数分类任务吗?
A:不适合。在 Banking77 高基数分类任务上,Laya 仅取得 0.425 准确率(77 个选项),而 Jev 达到 0.870(72 个选项)。如果任务涉及大量细粒度类别区分,建议考虑其他方案;Laya 更适合二分类、低基数分类和打分排序等场景。

Q:如何用自有数据微调 Laya?
A:Laya 附带 Kaggle notebook,支持完整的微调流程:造数据、RLCD 训练、温度拟合、评测。用户需准备标注好的结构化决策数据,按照 notebook 指引完成训练和评估。微调后需在自有数据上重新拟合温度参数,确保概率校准有效。

9. 项目地址

相关 AI 模型文章

讯飞Spark-ASR-2.0深度评测:非自回归架构下的语音识别新范式

讯飞Spark-ASR-2.0深度评测:非自回归架构下的语音识别新范式

Spark-ASR-2.0是科大讯飞基于星火语音基座大模型Spark-Audio推出的最新一代语音识别大模型。该模型延续了Spark-ASR-1.0的非自回归并行解码范式,并创新性地引入LLM增强的自回归识别机制,通过"非自回归+LLM增强自回归"协同架构,在中英文混合、方言、专业术语、高噪声小音量等复杂场景下实现了识别效果的显著提升,同时推理成本相较上一代仅增加10%。模型已率先在讯飞输入法中上...

Step Code – 阶跃星辰开源的终端编程智能体深度评测

Step Code – 阶跃星辰开源的终端编程智能体深度评测

Step Code 是阶跃星辰推出的开源终端编程智能体,采用 MIT License 许可,允许开发者在终端环境中直接完成代码编写、调试、执行与交付的完整工作流。该智能体在 Terminal Bench 2.1 评测中以 80.9% 的通过率并列第一,且 Token 消耗为并列者中最低;在自建 Multi-Frame 长程基准中同样排名第一。Step Code 内置 StepPage 一键发布静态...

Jev Search:开源 AI 搜索引擎,基于 Jev 模型实现意图解析与多引擎聚合

Jev Search:开源 AI 搜索引擎,基于 Jev 模型实现意图解析与多引擎聚合

Jev Search 是由 Search1API 团队开源的一款 AI 搜索引擎前端,其核心在于调用 TypeSafe 团队推出的 Jev 结构化决策模型,实现对用户自然语言提问的意图解析、搜索来源选择、时间范围限定与查询词自动生成。在 Jev 模型完成查询规划后,系统通过 Search1API 同时并行调用 Google、Reddit、Hacker News、arXiv 等 12 个搜索与内容引...

WebCraftBench – 腾讯联合清华推出的AI网页生成评测基准

WebCraftBench 是腾讯混元联合清华大学、北京大学推出的 AI 网页生成评测基准,旨在解决"AI 生成的网页应用质量如何客观评估"这一行业难题。该基准创新性地采用代码插桩与覆盖率引导的智能体探索机制,让 AI 智能体通过 Playwright 实际操作系统生成的网页应用,自动发现功能并测试边界情况,再通过状态抽象将交互记录转化为状态转移图,从美观度、易用性、需求符合度三个维度分别打分。基...

版权声明:本文部分内容由 AI 辅助生成并经人工校准,版权归本站所有,未经允许禁止任何形式的转载。