最新报道:币界网消息,Prime Intellect推理平台正式上线,内部每天处理接近1万亿tokens。该平台发布了开源模型推理服务prime inference,用户可以按需调用模型,支持长期稳定运行的算力锁定。接口兼容OpenAI API,首个公开部署的模型为glm-5.3。Prime Intellect从今年1月起为客户运行大规模部署,重点优化agent的长上下文负载,测试中将p90 token间延迟降低近40%。同时,Prime Intellect压缩了kv缓存,相同显存下每个解码器可缓存的token从109万增加到163万,提升约50%。