Blog
5 分钟阅读
案例研究:一家东欧银行如何从 33 tok/s 提升到 43 tok/s
一家位于东欧的银行面临着在受监管环境中运行 AI 的金融机构常见的难题:既需要更快的推理速度,又不能放弃对自身数据的掌控权。
某大型科技公司通过其卢森堡实验室开展工作,历时两个月才将该系统的运行速度提升至每秒 33 个 token(tok/s)——即模型生成回答的速度。这是一个可用的结果,但距离现有硬件所能发挥的能力仍有差距。
通过应用异构计算——编排该银行基础设施中已有的加速器,而非依赖单一处理向量——MultiCortex 将性能提升至 43 tok/s。
从 33 tok/s 到 43 tok/s 的这一跃升,意味着在完全相同的基础设施上实现了 30% 的生产力提升,既无需更换硬件,银行也无需放弃对数据的掌控。
这一案例很好地诠释了 MultiCortex 的目标:充分挖掘每一颗已安装芯片的潜力,而不是把购买更多硬件当作提升性能的唯一答案。