Inception Labs - 扩散大模型平台,Mercury 2.5、并行生成与低延迟API工具
Inception Labs 简介
Inception Labs是一家位于美国加州帕洛阿尔托的AI初创公司,由斯坦福大学教授Stefano Ermon(扩散模型共同发明人)、UCLA教授Aditya Grover和康奈尔大学教授Volodymyr Kuleshov于2024年联合创立。公司致力于将扩散模型技术从图像领域迁移至文本生成,开发了全球首个商业化的扩散大语言模型(dLLM)Mercury系列。与传统的自回归模型逐token串行生成不同,Mercury通过并行去噪过程一次性生成整块语言内容,实现了高达10倍的速度提升与显著的成本降低。
Inception Labs 核心功能/服务
Mercury 2.5扩散大模型:最新旗舰模型以超过1,100 tokens/秒的生产吞吐量运行,智能水平较Mercury 2提升10个点,可媲美GPT-5.6 Luna、Gemini 3.5 Flash-Lite与Claude Haiku 4.5等成本优化前沿模型。上下文窗口从128K扩展至260K,新增可调推理、原生工具调用与JSON模式。
实时推理与低延迟应用:扩散架构使推理延迟与推理深度解耦,响应时间不受思考步骤增加而显著延长。Mercury Voice实现首token延迟低于170ms,专为延迟预算紧张的语音Agent优化,适用于实时搜索、语音助手与编程辅助等场景。
OpenAI兼容API与多平台接入:平台提供drop-in API,可通过API Platform、OpenRouter、Vercel AI Gateway及AWS Marketplace调用。企业可申请私有实例或基于自有数据微调模型,价格低至$0.20/$0.75每百万tokens,发布期享80%折扣至$0.04/$0.15。
Inception Labs 适合谁
- 实时AI应用开发者:需要构建低延迟对话Agent、语音助手或实时搜索系统的开发者,可利用Mercury的并行生成能力将响应时间从分钟级压缩至秒级,提升用户体验。
- 企业AI平台与基础设施团队:关注推理成本与吞吐量的企业技术团队,可通过dLLM的token效率优势在相同GPU资源下处理更多请求,降低单位推理成本。
- AI研究与技术探索者:对扩散模型在文本生成领域应用感兴趣的开发者与研究人员,可借助Inception开源的模型权重与API接口,探索非自回归架构的能力边界。
为什么选择Inception Labs
Inception Labs由扩散模型共同发明人Stefano Ermon领导,团队在ICML 2024凭文本扩散论文获得最佳论文奖。公司于2025年11月完成5000万美元种子轮融资,Menlo Ventures领投,NVIDIA NVentures、微软M12、Snowflake Ventures、Databricks及吴恩达、Andrej Karpathy等天使投资人跟投。Mercury已被微软NLWeb选为底层模型,与TripAdvisor、Shopify、Snowflake等企业建立合作,企业用量月增长超过一个数量级。访问Inception Labs官网,体验Mercury的实时推理能力或查阅API文档。
数据统计
关于(Inception Labs)特别声明
Inception Labs收录自互联网,不保证外部链接的准确性和完整性,同时,对于该外部链接的指向,不由商娱网实际控制,在2026-10-02 11:24收录和巡查时,该网页上的内容,都属于合规合法,后期网页的内容如出现违规,可以直接联系网站管理员进行删除,商娱网不承担任何责任。
相关导航

ColossalChat

GPT6
LobeHub
Lepton AI

DeepSpeed
Anthropic



