Prime Intellect推出推理平台Prime Inference,首发…
工具AI 评分 78/100Prime Intellect(网页)待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
本条选题由第三方线索发现;线索方提供的摘要未被采用,本页内容依据下方信源整理。线索来源:AIHOT
Prime Intellect发布推理平台Prime Inference,提供无服务器端点与预留容量,支持多数据中心自动故障转移。该平台内部日处理近万亿token,现已上线GLM-5.3公开端点,实现近零工具调用错误率与100%正常运行时间。底层采用NVIDIA Blackwell等算力,整合vLLM与NVIDIA Dynamo等开源组件,兼容OpenAI接口。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载平台核心能力与规模
Prime Inference旨在为前沿开源模型提供弹性且高可用的推理服务,涵盖无服务器端点以应对可变需求,以及预留容量面向持续负载。该平台脱胎于内部基础设施,在大规模强化学习推演、合成数据生成及长周期编码智能体运行中,每日内部处理量接近一万亿token。自一月份起,该系统已支撑外部客户的大规模生产级部署,促使团队将优化重心转向持续性能与可靠性,而非仅追求基准测试速度。
首发端点表现与算力
九月二十二日,平台首个公开部署GLM-5.3端点在OpenRouter上线,目前位列该平台最快GLM-5.3端点之一,达成近零工具调用错误率及自上线起百分之百的可用性。算力层面,Prime托管的模型当前运行于NVIDIA Blackwell架构,并计划后续引入Vera Rubin。跨数据中心自动故障转移机制保障了流量始终导向健康部署实例。
技术栈与接口兼容
平台底层构建于开源基础设施之上,组合了NVIDIA Dynamo、vLLM、Mooncake与FlashInfer,相关改进已回馈至上游社区,此过程与Inferact及NVIDIA保持密切合作。接口方面完全兼容OpenAI规范,开发者可使用现有工具与SDK通过Prime端点及API密钥直接接入。计费采用统一模式,支持团队级使用量追踪,简化推理支出管理。
为什么值得看
提供高可靠前沿开源模型推理服务,以极低错误率与百倍正常运行时间吸引生产级部署。
OpenAI算力数据中心
信源1 家
关键事实
相关 · 工具
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
