Longcat-2.5-preview深度评测:美团新一代多模态长程Agent大模型

导读摘要:
LongCat-2.5-Preview是美团最新推出的新一代大模型,在延续LongCat-2.0的1.6T总参数、约48B激活参数和1M token原生上下文基础上,首次将多模态能力直接融入基座本体,面向终端、浏览器、桌面软件等场景执行长流程Agent任务。该模型已接入官方API,同时兼容OpenAI和Anthropic双接口协议,支持最大128K tokens输出,并可被Codex、OpenCl...
1. LongCat-2.5-Preview是什么
LongCat-2.5-Preview是美团最新推出的新一代大模型,在延续LongCat-2.0的1.6T总参数、约48B激活参数和1M token原生上下文基础上,首次将多模态能力直接融入基座本体,面向终端、浏览器、桌面软件等场景执行长流程Agent任务。该模型已接入官方API,同时兼容OpenAI和Anthropic双接口协议,支持最大128K tokens输出,并可被Codex、OpenClaw等主流Agent工具直接调用,实现了从纯文本编码模型向多模态长程智能体的关键升级。

图片来源为官方文章
技术定位与领域: 属于大规模稀疏激活语言模型领域,融合MoE架构与多模态联合建模,定位为可执行长流程真实软件操作的Agent基座模型,覆盖编程、办公自动化、GUI操作等场景。
研发背景: 由美团LongCat团队开发,延续LongCat-2.0的1.6T总参数MoE路线,并在LongCat-Next验证的DiNA(离散原生自回归)范式基础上,将图像理解整合进基座本体,不再拆分独立视觉仓库。
核心价值: 解决百万级上下文条件下多模态联合建模系统工程难题,同时通过双接口兼容策略,让现有OpenAI/Anthropic生态的Agent工具近乎零迁移直接接入,显著降低长程任务落地门槛。
技术特点: MoE稀疏激活(1.6T总参/48B激活)搭配原生1M token上下文,多模态词元与文本统一离散建模,支持dlp投机解码加速推理。
2. 主要功能
原生多模态基座建模: 不同于2.0时代将图像、视频拆分为独立开源仓库,2.5将视觉编码直接并入基座本体,图像与文本在同一模型内联合建模,支持跨模态问答、内容摘要与复杂视觉推理,交互体验更统一。
长程GUI Agent任务: 面向终端、浏览器、GUI、电子表格、设计工具等真实软件界面执行长流程自主操作,可完成"抓取网页数据→清洗→填入Excel→生成报告"这类多步骤无人值守任务。
Agentic Coding能力: 在代码生成、代码理解与自动化编程任务上延续LongCat-2.0的定位,支持跨文件重构、缺陷定位与大型PR生成,通过Claude Code、OpenCode等工具直接驱动。
双协议API接口: 同时兼容OpenAI和Anthropic两种API格式,最大输出128K tokens,现有Agent工具仅需修改base_url与模型名即可接入,无需改动应用逻辑。
开发环境深度适配: 与Claude Code、Hermes、OpenClaw、OpenCode、Kilo Code等主流Agent工具高效协同,官方提供接入教程,覆盖主流编码与自动化场景。
百万级上下文记忆: 原生1M token窗口可单次容纳超长文档、整个代码库、系统日志与多轮复杂任务,为长程Agent的多步骤执行提供完整记忆基础。
3. 如何使用
注册开放平台账号: 打开LongCat开放平台(https://longcat.ai/platform/),注册并登录美团LongCat账户,进入控制台。
创建API Key: 在控制台导航中找到API密钥管理页面,创建一个新的API Key,妥善保存该密钥,后续所有调用均需携带。
配置SDK与base_url: 使用现有的OpenAI或Anthropic官方SDK,无需额外安装新客户端。将base_url修改为
(链接待官方发布后更新)(OpenAI格式)或(链接待官方发布后更新)(Anthropic格式),填入刚创建的Key。指定模型并发起请求: 模型ID填写
LongCat-2.5-Preview,按OpenAI chat.completions或Anthropic messages标准格式发送请求,支持图片输入与长文本生成。接入Agent工具(以Claude Code为例): 在环境变量中设置
ANTHROPIC_BASE_URL=(链接待官方发布后更新)和ANTHROPIC_AUTH_TOKEN=你的Key,将ANTHROPIC_MODEL设为LongCat-2.5-Preview,启动Claude Code即可直接调用。OpenClaw、OpenCode、Codex等工具同理。网页端直接体验: 访问LongCat官网(https://longcat.ai/)登录后选择LongCat-2.5-Preview模型,可在网页端进行对话、传图和简单Agent任务体验,无需编写代码。
4. 优缺点分析
| 优点 |
|---|
| 超大稀疏模型与低成本推理: 1.6T总参数仅激活约48B,MoE动态路由在保证模型容量同时有效控制单次推理计算开销,兼顾能力上限与成本考量。 |
| 百万级原生上下文: 1M token窗口可一次性容纳整个代码库或完整日志,配合128K最大输出,在超长文档分析与长流程记忆保持方面具备显著优势。 |
| 原生多模态进基座: 沿用DiNA离散原生自回归范式,视觉与文本统一为离散token联合建模,避免2.0时代多模态仓库拆分带来的交互割裂问题。 |
| 双协议零迁移接入: 同时兼容OpenAI与Anthropic接口,现有Agent工具改个base_url即可调用,极大降低开发者迁移成本和生态切换摩擦。 |
5. 同类工具对比
| 对比维度 | LongCat-2.5-Preview | Claude Opus 5.5 |
|---|---|---|
| 核心架构 | MoE稀疏激活,1.6T总参/48B激活,多模态并入基座 | 稠密Transformer架构,原生多模态(图像/文档成熟) |
| 上下文窗口 | 原生1M tokens | 1M tokens |
| 最大输出 | 128K tokens | 128K tokens |
| 接口协议 | 同时兼容OpenAI + Anthropic双协议 | 仅Anthropic协议 |
| GUI Agent能力 | 刚起步,覆盖浏览器/桌面/表格操作,无公开benchmark | Claude Computer Use已商用迭代多代,大量实测数据 |
| API定价 | 按token套餐计费,赠送500万免费tokens,性价比定位明确 | $4 / $20每百万tokens(约¥29 / ¥143),旗舰档价位 |
| 生态工具接入 | 官方教程覆盖Codex / OpenClaw / Claude Code / OpenCode等 | Claude Code、Cowork等官方工具链深度绑定 |
| 数据透明度 | 无官方benchmark,第三方评测尚缺 | SWE-bench等评测公开可查,第三方生态丰富 |
选型建议: 对于已有大量基于OpenAI或Anthropic协议开发的应用团队,LongCat-2.5-Preview的双协议兼容特性和免费token赠送降低了迁移门槛,尤其适合需要处理超长代码库和百万级文档场景的中小型团队,在控制成本的同时获得旗舰级模型的上下文能力。
对于依赖成熟GUI自动化能力和丰富第三方生态的企业级用户,Claude Opus 5.5的Computer Use方案经过多轮迭代验证,在浏览器操作、桌面软件交互的稳定性和边界情况处理上更具优势,适合对任务可靠性有严格要求的金融、政务等领域。
6. 编辑总结
LongCat-2.5-Preview在技术路线上做出了明确的差异化选择:将1.6T参数的MoE架构与原生多模态进行基座级融合,同时保留1M token的百万级上下文,这一组合在当前大模型市场中较为少见。从技术角度看,DiNA离散原生自回归范式的延续使视觉信息与文本在同一语义空间内建模,避免了late-fusion方案中常见的模态对齐偏差问题;而1.6T总参数仅激活48B的设计,则在模型容量与推理成本之间取得了较好的平衡点。
该模型最突出的实用价值在于双协议API兼容策略,这使其能够以极低的迁移成本融入现有的OpenAI或Anthropic开发工具链。对于依赖Claude Code、OpenClaw等工具的开发者而言,仅需修改环境变量即可切换底层模型,这种"即插即用"的接入方式有效降低了Agent应用的替换成本。同时,原生多模态并入基座的设计,在长文档分析与图像理解相结合的场景中具备天然的协同优势。
不过,模型在GUI Agent能力上的公开验证数据仍然欠缺,官方未公布SWE-bench等标准评测结果,这在一定程度上影响了技术选型时的可参考性。面向实际生产环境部署时,API服务的稳定性指标和长期限流策略也需进一步观察。综合来看,LongCat-2.5-Preview适合对超长上下文处理、成本控制和多模态联合建模有明确需求的开发团队,尤其在国产算力生态下具备较强的工程适配前景。随着后续版本迭代和benchmark数据的补充,其在长程Agent领域的市场空间值得持续关注。
7. 应用场景
全代码库级编程助手: 借助1M上下文一次性加载整个仓库源码,完成跨文件重构、缺陷定位与大型PR生成。开发者通过Claude Code或OpenCode配置LongCat-2.5-Preview为底层模型,即可在IDE中实现基于全仓上下文的代码智能补全与自动化修改。
跨软件长流程办公自动化: 模型可操作浏览器+电子表格+桌面软件,执行"抓取网页数据→清洗→填入Excel→生成报告"这类多步骤无人值守任务。企业可将重复性数据整理流程交由Agent自动完成,释放人力资源投入更高价值工作。
企业级日志与文档分析: 将百万token级的系统日志、合同档案或论文语料整体投喂,进行一次性深度问答、摘要和异常挖掘,避免RAG切片造成的上下文断裂。适用于运维排障、法律文档审阅与科研文献调研等场景,提升分析深度与效率。
GUI界面测试与运维: 自动操作终端和桌面软件,执行批量配置、界面回归测试、老旧系统的自动化录入等人工密集型操作。模型通过视觉理解界面元素并结合自然语言指令,可实现对非标准化GUI的有效自动控制。
多模态内容生产辅助: 结合新增的图片理解能力,完成截图转代码、设计稿还原(对接设计工具)以及图文混合资料的结构化整理与再创作,为内容生产流程引入更强的多模态认知能力。
8. 常见问题FAQ
Q:LongCat-2.5-Preview与LongCat-2.0的核心区别是什么?
A:核心区别在于多模态能力的位置。2.0将图像、视频能力拆分为独立开源仓库,需要分别部署和调用;2.5将多模态直接融入基座本体,视觉信息与文本在同一模型内联合建模,通过DiNA范式将图像离散化为token统一处理,用户无需额外加载视觉模块即可获得图文联合理解能力。
Q:如何将现有的OpenAI SDK改造成接入LongCat-2.5-Preview?
A:无需更换SDK或修改业务代码,只需将base_url参数改为(链接待官方发布后更新),API Key换成在LongCat开放平台创建的密钥,模型ID指定为LongCat-2.5-Preview即可。所有请求格式保持OpenAI chat.completions标准不变,支持图像输入等扩展字段。
Q:接入Anthropic协议的Agent工具(如Claude Code)需要注意什么?
A:需设置三个环境变量:ANTHROPIC_BASE_URL指向(链接待官方发布后更新),ANTHROPIC_AUTH_TOKEN填入你的API Key,ANTHROPIC_MODEL设为LongCat-2.5-Preview。需注意部分工具内部可能硬编码了Anthropic特有参数,建议先在小规模任务上验证兼容性,再放大到生产环境。
Q:模型支持什么类型的图片输入?有无大小与格式限制?
A:目前支持常见静态图片格式(如JPEG、PNG、WebP),具体大小限制和分辨率要求以官方文档为准,建议上传单张不超过数MB的图片以保证响应速度。对于复杂图表、截图和设计稿的解析表现较优,但视频输入尚未在官方渠道明确支持。
Q:1M token的上下文处理对硬件资源有什么要求?
A:由于模型采用MoE架构仅激活约48B参数,单次推理所需显存远小于1.6T全参数加载需求。但处理1M token级别的长提示词时,KV Cache的内存开销会显著增长,实际部署需要充足的高带宽显存与内存资源。具体硬件配置建议参考官方部署文档,云端API调用无需本地硬件支持。
Q:如何获取API免费额度与定价详情?
A:官方赠送500万免费tokens供新用户试用,可覆盖中小规模验证需求。超出部分按token套餐计费,具体价格表在开放平台控制台展示。建议在生产环境上线前充分评估长上下文任务的实际token消耗,合理规划预算。
9. 项目地址
- 产品官网: https://longcat.ai/
- 官方开放平台(API控制台与Key管理): https://longcat.ai/platform/
相关 AI 模型文章

OpenMuse – CopilotKit 开源的个人 AI 助理
OpenMuse 是由 CopilotKit 团队开源的个人 AI 助理项目,其核心设计理念是"给 Agent 配一台电脑"——通过持久化浏览器、可选 Linux Docker 容器和文件系统的组合,让 AI 代理能够在后台持续运行复杂任务,并允许用户随时暂停、接管或恢复操作。该项目面向 iOS、Android 和 Web 三端,内置了 Gmail 与日历集成、PDF 表单填写、网页监控、支出分析...

DeepSeek Harness 桌面版评测:官方 GUI 客户端如何降低 Agent 使用门槛
DeepSeek Harness 桌面版是 DeepSeek 官方推出的图形化客户端,旨在为原本基于命令行的 DeepSeek Harness 框架提供可视化操作界面。用户登录 DeepSeek 账号或配置 API Key、选定本地工作区后,即可像使用普通桌面 AI 应用一样,以自然语言向 Agent 布置任务。该客户端支持标准、PTC、极简、创造四种工作模式,内置多 Agent 协作、语音输入、...

Step Code – 阶跃星辰开源的终端编程智能体深度评测
Step Code 是阶跃星辰推出的开源终端编程智能体,采用 MIT License 许可,允许开发者在终端环境中直接完成代码编写、调试、执行与交付的完整工作流。该智能体在 Terminal Bench 2.1 评测中以 80.9% 的通过率并列第一,且 Token 消耗为并列者中最低;在自建 Multi-Frame 长程基准中同样排名第一。Step Code 内置 StepPage 一键发布静态...
Claude Opus 5.5 深度评测:Anthropic 旗舰模型的编程效率与安全范式革新
Claude Opus 5.5是Anthropic于2026年6月推出的Claude 5.5系列首款旗舰模型,定位为面向企业级智能体编程、复杂知识工作与自动化业务流的高端AI模型。该模型在Terminal-Bench 4.0编程基准上取得66.4%的成绩,在GDPval-AA v2.1知识工作基准上达到1846 Elo,双双领先OpenAI同期旗舰GPT-6 Astra。除性能提升外,Opus 5...
版权声明:本文部分内容由 AI 辅助生成并经人工校准,版权归本站所有,未经允许禁止任何形式的转载。
