返回模型列表

LongCat-2.0 – 美团开源的一代万亿参数语言模型

AI科技编辑部
RSS 订阅
LongCat-2.0 – 美团开源的一代万亿参数语言模型 官方截图
(图片来源官方截图)

导读摘要:

LongCat-2.0是美团开源的新一代大规模MoE语言模型,拥有1.6万亿总参数,每token激活约480亿参数,基于五万卡国产AI ASIC超算集群完成全链路训练与部署。该模型原生支持高达1M token的超长上下文窗口,并引入了LongCat Sparse Attention(LSA)稀疏注意力机制与N-gram Embedding架构,在代码生成、自主Agent任务执行以及复杂推理等场景中...

1. LongCat-2.0是什么

LongCat-2.0是美团开源的新一代大规模MoE语言模型,拥有1.6万亿总参数,每token激活约480亿参数,基于五万卡国产AI ASIC超算集群完成全链路训练与部署。该模型原生支持高达1M token的超长上下文窗口,并引入了LongCat Sparse Attention(LSA)稀疏注意力机制与N-gram Embedding架构,在代码生成、自主Agent任务执行以及复杂推理等场景中展现出强劲性能。LongCat-2.0已与Claude Code、OpenClaw、Hermes等主流AI开发工具深度集成,可通过OpenRouter平台开放调用,月调用量跻身全球前三,成为国产大模型走向国际舞台的重要标志。

longcat-2-0 官网截图
(图片来源官方截图)

技术定位与领域: LongCat-2.0属于大规模混合专家(MoE)语言模型领域,专注于长上下文理解、代码智能与自主Agent执行。其独特之处在于,它是业界首个在非NVIDIA平台上(五万卡国产ASIC集群)完成万亿参数模型全流程训练与推理的模型,验证了国产算力基础设施支撑超大规模AI模型的可行性。模型在SWE-bench Pro、Terminal-Bench等代码与Agent评测基准上超越了Gemini 3.1 Pro和GPT-5.5等国际竞品。

研发背景: 由美团AI团队主导研发,依托美团在搜索、推荐、广告、本地生活服务等场景积累的海量数据与工程经验。研发动机源于对长文档理解、仓库级代码分析、复杂Agent任务等实际业务需求的深入洞察,旨在打造一款既能处理超长上下文,又能在代码和Agent任务中达到顶尖水平的通用大模型。美团在AI基础设施上的长期投入(包括自研ASIC和超算集群)为这一目标的实现提供了硬件基础。

核心价值: LongCat-2.0解决了传统大模型在超长上下文处理中的“中间遗忘”问题,通过LSA机制将百万token级别的注意力计算从平方级降至线性级,使得模型能够一次性读取完整代码库或长篇技术文档进行精准定位与深度理解。同时,其MOPD(Multi-Expert On-Policy Distill)后训练架构融合了Agent、Reasoning、Interaction三类专家,通过门控网络动态调度,在单一模型中兼顾了执行效率、推理深度与交互体验,大幅降低了多模型组合的复杂度和成本。

技术特点: 采用MoE稀疏激活架构(总参数1.6T,激活480B),结合零计算专家与ScMoE实现token级动态计算分配,简单token不消耗算力,复杂任务自动获取更多专家资源。引入5-gram嵌入模块,将嵌入空间扩展约100倍,捕获更丰富的局部上下文。在训练层面,采用6D并行策略(在TP/CP/EP/DP/PP基础上新增EMBP),结合Superpod物理集群架构,实现了超大规模高效训练。

2. 主要功能

  • 超长上下文理解: 原生支持1M token上下文窗口,可一次性读取完整代码库、长文档进行精准定位与深度理解。通过LongCat Sparse Attention(LSA)机制,将注意力计算复杂度从平方级降至线性级,有效避免了传统模型在处理超长文本时的“中间遗忘”问题,在长文本检索和摘要任务中表现优异。

  • 代码生成与重构: 基于Agentic Coding能力,支持仓库级代码分析、跨文件逻辑梳理、架构迁移与功能重构。模型能够理解整个项目结构,自动完成从旧SDK到新SDK的代码迁移,并修复潜在的兼容性Bug,编译一次通过率显著高于同类模型。

  • 自主Agent执行: 深度集成Claude Code、OpenClaw、Hermes等主流harness,可自主完成多步骤任务规划、工具调用、API交互与错误自纠错。在Terminal-Bench等Agent评测中,模型能够根据用户自然语言指令自动分解任务、调用命令行工具并处理异常,展现出接近人类工程师的自主执行能力。

  • 多语言代码支持: 具备跨语言代码理解与生成能力,支持中英等多语言编程场景下的代码迁移与审查。模型能够自动识别不同编程语言的语法特性,在混合语言项目中保持一致的逻辑一致性,特别适合跨国团队或开源项目的多语言代码库维护。

  • 智能搜索与检索: 内置搜索与浏览能力,支持复杂信息检索、多跳推理与跨网页内容整合。模型可以主动发起网络搜索,对多个来源的信息进行交叉验证和摘要,满足研究型任务对信息广度和深度的双重需求,无需外部检索插件即可完成。

  • 自然语言数据查询: 业务人员可直接用自然语言查询数据库,模型自动完成意图解析、SQL生成、执行与结果洞察输出。该功能降低了数据获取门槛,使得非技术用户也能快速从企业数据库中获取所需信息,并在输出时附带数据可视化建议。

3. 如何使用

  1. 在线体验: 访问LongCat官网((链接待官方发布后更新)

  2. API接入: 登录 https://longcat.chat/platform/product 获取API Key,集成到自有应用或Agent框架。API支持流式输出,可配置temperature、top_p等参数。建议开发者优先使用Python SDK(官方提供),并参考文档中的速率限制说明进行合理调度。

  3. 工具集成: 直接接入Claude Code、OpenClaw、Hermes等主流AI开发工具链作为底层模型驱动。以Claude Code为例,在配置文件中指定模型为LongCat-2.0即可启用。注意需要确保工具版本支持自定义模型端点,部分工具可能需要手动设置base_url。

  4. 本地部署(企业版): 针对需要私有化部署的企业客户,美团提供基于五万卡国产ASIC集群的解决方案。部署前需确认硬件环境(推荐至少单节点8卡昇腾910B或沐曦MXN100),并安装配套的MLGuider推理引擎。具体部署流程可联系美团AI团队获取技术支持文档。

  5. 模型权重获取: 从HuggingFace((链接待官方发布后更新)

  6. 最佳实践: 在超长上下文任务中,建议将输入文本按逻辑段落分段,并在关键位置添加显式标记(如[SEP]),以帮助LSA机制更高效地定位重要信息。对于代码生成任务,建议提供完整的项目目录结构和依赖文件,以提升仓库级分析的准确性。Agent任务中,建议在系统提示中明确指定可用工具列表和权限边界,避免模型产生意外行为。

4. 优缺点分析

优点
超长上下文支持: 原生1M token上下文窗口,配合LSA稀疏注意力机制,有效解决长文本处理中的“中间遗忘”问题,在文档级理解和代码库分析中表现突出。
国产算力全链路验证: 业界首个在五万卡国产ASIC集群上完成预训练、微调、推理全流程的万亿参数模型,证明非NVIDIA平台同样可支撑超大规模AI模型。
代码与Agent能力领先: 在SWE-bench Pro(59.5分)和Terminal-Bench等基准上超越Gemini 3.1 Pro和GPT-5.5,Agent任务中的自主执行和错误恢复能力接近人类水平。
动态计算分配: 零计算专家+ScMoE实现token级动态激活(33B~56B),简单token不消耗算力,复杂任务自动获取更多资源,在推理效率与质量之间取得较好平衡。

5. 同类工具对比

对比维度 LongCat-2.0 DeepSeek-V3 GPT-4o
发布方 美团 DeepSeek OpenAI
总参数 1.6万亿 (MoE) 6710亿 (MoE) 约1.8万亿 (传闻,未确认)
激活参数 ~480亿/token ~370亿/token 未公开
上下文长度 1M tokens 64K-128K tokens 128K tokens
训练硬件 五万卡国产ASIC集群 NVIDIA GPU集群 NVIDIA GPU集群
注意力机制 LongCat Sparse Attention (LSA) Multi-head Latent Attention (MLA) 标准多头注意力 + 稀疏注意力
嵌入优化 N-gram Embedding (5-gram, 135B) 标准嵌入层 标准嵌入层
后训练架构 MOPD (Agent/Reasoning/Interaction专家融合) 标准SFT + RL RLHF + 指令微调
代码能力 (SWE-bench Pro) 59.5 ~50+ ~48 (估计)
Agent任务支持 深度集成Claude Code/OpenClaw/Hermes 通过开源框架支持 通过Assistants API支持
开源协议 部分开源(权重和代码) MIT开源 闭源
社区生态 起步阶段,月调用量全球前三 成熟,广泛使用 非常成熟,开发者众多

选型建议: 对于需要极致代码生成和Agent自主执行能力的团队,LongCat-2.0是当前开源模型中的最佳选择,尤其在仓库级代码迁移和复杂多步骤任务场景中优势明显。其1M上下文窗口使其在处理大型代码库和长篇技术文档时远超DeepSeek-V3和GPT-4o。但若团队对通用知识问答、创意写作等需求较高,且缺乏国产算力集群支持,则DeepSeek-V3(MIT开源、社区成熟)或GPT-4o(闭源但API稳定)可能更合适。对于已经使用Google Cloud生态的企业,Gemini 2.0 Pro的TPU优化和1M上下文实验性支持也值得考虑,但其代码能力目前弱于LongCat-2.0。

6. 编辑点评

LongCat-2.0的发布标志着国产大模型在万亿参数级别实现了从“跟跑”到“并跑”的跨越。技术创新方面,LSA稀疏注意力机制为百万token上下文提供了可落地的工程方案,其流式感知索引、跨层索引和分层索引的设计思路值得行业借鉴;N-gram Embedding将嵌入空间扩展100倍,在捕获局部上下文方面比标准嵌入层更具优势;MOPD后训练架构通过多专家融合实现任务级动态调度,在单一模型中同时优化了执行、推理和交互三个维度,这种设计比传统的SFT+RL方案更加精细。实用价值方面,LongCat-2.0在SWE-bench Pro上取得59.5分,超过Gemini 3.1 Pro和GPT-5.5,证明其在代码领域的实用性已处于业界顶尖水平。同时,作为首个在五万卡国产ASIC集群上完成全流程的万亿参数模型,它展示了国产算力支撑超大规模AI的可行性,对国内AI产业链自主可控具有重要意义。适用人群定位清晰:AI Agent开发者、代码库维护团队、需要超长文档处理的研究人员,以及希望摆脱NVIDIA硬件依赖的企业用户。未来发展潜力巨大——随着社区生态的完善和更多第三方工具的支持,LongCat-2.0有望成为开源大模型在代码和Agent领域的标杆。但需注意,其通用任务能力尚未充分验证,且硬件门槛限制了个人开发者的使用。

7. 应用场景

  • 大规模代码迁移: 当企业需要将旧系统从一种技术栈迁移到另一种(如从Java迁移到Go,或从Spring Boot迁移到Quarkus)时,LongCat-2.0可一次性读取整个代码库和迁移文档,自动映射架构并重构插件至新SDK,保留原有功能并修复潜在Bug。其1M上下文窗口使得跨文件逻辑梳理变得可行,大幅降低人工审查成本。

  • 仓库级代码审查: 开发团队可在代码提交前,将整个项目仓库(包括所有源文件、配置文件、测试用例)输入LongCat-2.0,模型基于对项目结构的完整理解,进行跨文件Bug检测、性能优化建议和架构改进方案。相比传统逐文件审查,这种方式能发现因跨文件依赖而产生的隐蔽问题。

  • AI Agent开发: 作为底层模型驱动Claude Code、OpenClaw、Hermes等框架,LongCat-2.0可执行复杂多步骤任务,例如:自动部署一个Web应用(包括环境配置、代码编译、数据库初始化、域名绑定),并在出现错误时自主分析日志并修复。其零计算专家机制确保了在简单步骤中不浪费算力,而在复杂调试环节自动激活更多专家资源。

  • 长文档分析与生成: 研究人员可将百万字级的技术文档、学术论文、行业报告一次性输入模型,进行深度摘要、问答和内容改写。例如,分析一份500页的专利文档,提取核心技术点并生成对比表;或基于多篇论文生成综述报告。LSA机制保证了文档开头和结尾的信息都能被有效关注。

  • 数据查询与洞察: 企业业务人员(如运营、市场、产品经理)可直接用自然语言向LongCat-2.0查询数据库,例如“上个月华东地区销售额排名前十的产品是什么?”模型自动完成意图解析、SQL生成、执行,并输出结果洞察(如“华东地区销售额环比增长12%,其中A产品贡献最大”)。该功能将数据获取门槛从“会SQL”降至“会用自然语言表达需求”。

8. 常见问题FAQ

Q:LongCat-2.0的1M上下文窗口是真实可用的吗?还是只是实验性支持?
A:1M上下文窗口是原生支持的,并且通过LongCat Sparse Attention(LSA)机制实现了线性复杂度注意力计算,在实际测试中能够有效处理百万token级别的输入。不过,由于显存和带宽限制,建议在推理时根据实际硬件配置合理设置上下文长度,例如在单节点8卡环境下推荐使用256K~512K,在多节点集群中可充分发挥1M能力。

Q:LongCat-2.0与DeepSeek-V3相比,哪个更适合代码生成?
A:根据SWE-bench Pro评测,LongCat-2.0得分为59.5,DeepSeek-V3约为50+,LongCat-2.0在代码生成和仓库级分析方面明显领先。此外,LongCat-2.0的1M上下文窗口使其能够处理更大的代码库,而DeepSeek-V3的上下文上限为128K。但DeepSeek-V3有更成熟的社区生态和更多第三方工具支持,且采用MIT开源协议,商业使用更灵活。

Q:我能在普通消费级显卡上运行LongCat-2.0吗?
A:不能直接运行。LongCat-2.0总参数达1.6T,即使激活参数仅480B,也需要大规模分布式集群(例如多节点昇腾910B或NVIDIA A100 80G集群)。个人开发者建议通过API(https://longcat.chat/platform/product)或OpenRouter平台调用,无需本地部署。

Q:LongCat-2.0支持哪些语言?中文能力如何?
A:模型支持中英等多语言,在中文代码生成、中文长文档理解方面表现优异。由于美团在中文场景有深厚积累,模型在中文自然语言查询数据库、中文技术文档处理等任务上具有优势。但需注意,模型主要针对代码和Agent任务优化,在中文文学创作等创意性任务上可能不如专门的中文通用模型。

Q:LongCat-2.0的开源协议是什么?可以用于商业项目吗?
A:模型权重和代码已在GitHub和HuggingFace上开源,具体协议请查阅仓库中的LICENSE文件。根据公开信息,模型采用类似Apache 2.0的宽松许可证,允许商业使用和修改,但建议企业在使用前仔细阅读条款,特别是关于衍生作品分发和版权声明的部分。

Q:如何将LongCat-2.0集成到现有的Agent框架中?
A:以Claude Code为例,在配置文件中设置model_provider: "longcat"并填写API端点即可。对于OpenClaw和Hermes,需要修改工具配置中的base_url和模型名称。官方提供了Python SDK,支持OpenAI兼容的API格式,因此大多数支持OpenAI接口的工具都可以直接接入。具体集成步骤可参考GitHub仓库中的文档。

Q:LongCat-2.0的推理速度如何?延迟高吗?
A:得益于零计算专家和ScMoE的动态计算分配,简单token的推理速度很快。在API调用中,首token延迟通常在1-3秒(取决于输入长度),后续生成速度约为每秒30-50 tokens(激活480B参数时)。对于长上下文任务,LSA机制使得注意力计算不随上下文长度平方增长,因此即使处理百万token输入,延迟增长也是线性的。

9. 项目地址

相关 AI 模型文章

Claude Haiku 5.5 – Anthropic 推出的最轻量级模型

Claude Haiku 5.5 – Anthropic 推出的最轻量级模型

Claude Haiku 5.5 是 Anthropic 于 2026 年 10 月 7 日正式发布的最新小型语言模型,定位为"最便宜、最快、最能打"的高性价比产品。该模型将输入价格降至 $0.10/百万 token,综合成本降低约 75%,同时实现了电脑操作能力从 15.7% 到 72.4% 的大幅跃升。其支持 100 万 token 上下文窗口和五档可调思考机制,适用于智能摘要、数据分类、实时...

Startlux-Decision – StartLux Labs 开源的决策模型家族深度评测

StartLux-Decision 是 StartLux Labs 推出的开源决策模型家族,涵盖从 0.8B 至 27B 的五个稠密模型以及 35B-A3B 混合专家模型,专为类型化决策任务设计。该模型家族接收文本、JSON 或图片形式的状态输入,针对选择、是非、评分等结构化问题,通过单次前向推理直接返回每个选项的概率分布,天然可作为置信度使用。模型原生支持 256K token 超长上下文,具备...

SemIf – 开源的 AI 决策模型,复现 Jev 语义决策模式

SemIf – 开源的 AI 决策模型,复现 Jev 语义决策模式

SemIf(原 OpenJev)是一个开源的 AI 决策模型,旨在通过开源手段复现 TypeSafe 闭源服务 Jev 的语义决策接口模式。该模型采用单次前向传播机制,直接读取候选选项对应的 logits 进行打分,由服务端构造结构化结果,从而规避了传统自回归生成后再解析文本的复杂流程。在多个问题共享相同状态时,SemIf 还可复用前缀计算,吞吐量提升近一个数量级。该模型在单张 RTX 3090 ...

MAI-Transcribe-2-Streaming:微软实时流式语音转写模型深度评测

MAI-Transcribe-2-Streaming 是微软推出的首个实时流式语音转写模型,能够在讲话进行时持续输出文字,覆盖 60 种语言并自动检测语言切换。该模型在 Artificial Analysis 流式转写榜单中以 2.50% 的词错误率和 0.13 秒的最终转录延迟双双登顶,首批文本延迟低至数百毫秒,文字最快在语音后 320 毫秒显示。其核心价值在于将传统语音转写从"说完再识别"的批...

版权声明:本文部分内容由 AI 辅助生成并经人工校准,版权归本站所有,未经允许禁止任何形式的转载。