Prime Intellect推出推理平台Prime Inference,首发…

工具AI 评分 78/100Prime Intellect(网页)待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

本条选题由第三方线索发现;线索方提供的摘要未被采用,本页内容依据下方信源整理。线索来源:AIHOT

Prime Intellect发布推理平台Prime Inference,提供无服务器端点与预留容量,支持多数据中心自动故障转移。该平台内部日处理近万亿token,现已上线GLM-5.3公开端点,实现近零工具调用错误率与100%正常运行时间。底层采用NVIDIA Blackwell等算力,整合vLLM与NVIDIA Dynamo等开源组件,兼容OpenAI接口。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

平台核心能力与规模

Prime Inference旨在为前沿开源模型提供弹性且高可用的推理服务,涵盖无服务器端点以应对可变需求,以及预留容量面向持续负载。该平台脱胎于内部基础设施,在大规模强化学习推演、合成数据生成及长周期编码智能体运行中,每日内部处理量接近一万亿token。自一月份起,该系统已支撑外部客户的大规模生产级部署,促使团队将优化重心转向持续性能与可靠性,而非仅追求基准测试速度。

首发端点表现与算力

九月二十二日,平台首个公开部署GLM-5.3端点在OpenRouter上线,目前位列该平台最快GLM-5.3端点之一,达成近零工具调用错误率及自上线起百分之百的可用性。算力层面,Prime托管的模型当前运行于NVIDIA Blackwell架构,并计划后续引入Vera Rubin。跨数据中心自动故障转移机制保障了流量始终导向健康部署实例。

技术栈与接口兼容

平台底层构建于开源基础设施之上,组合了NVIDIA Dynamo、vLLM、Mooncake与FlashInfer,相关改进已回馈至上游社区,此过程与Inferact及NVIDIA保持密切合作。接口方面完全兼容OpenAI规范,开发者可使用现有工具与SDK通过Prime端点及API密钥直接接入。计费采用统一模式,支持团队级使用量追踪,简化推理支出管理。

为什么值得看

提供高可靠前沿开源模型推理服务,以极低错误率与百倍正常运行时间吸引生产级部署。

OpenAI算力数据中心

信源1 家

  1. [1]Prime Intellect(网页)线索来自 AIHOTPrime Intellect 发布推理平台 Prime Inference,已上线 GLM-5.3 端点

关键事实

  • Prime Intellect发布推理平台Prime Inference,提供无服务器端点与预留容量两种扩缩容方式[1]

  • 该平台内部日处理近万亿token,自一月起支撑大规模客户生产部署[1]

  • GLM-5.3公开端点九月二十二日上线OpenRouter,工具调用错误率近零,正常运行时间百分之百[1]

  • 底层运行于NVIDIA Blackwell,整合NVIDIA Dynamo、vLLM、Mooncake及FlashInfer[1]

相关 · 工具

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。