OmniTools 9月19日消息,Positron联合创始人Thomas Sohmers在近期访谈中指出,当前AI推理性能主要受限于内存带宽而非算力:2014至2024年间GPU浮点运算能力(FLOPS)增长约120倍,而内存带宽仅提升17倍。
他估算,现有500兆瓦NVIDIA算力负载有望通过优化压缩至100兆瓦;键值(KV)缓存读取成本约为重新计算的千分之一,这或可解释Anthropic报道中高达80个百分点的API毛利率。
审批流程、电网承载能力、项目融资及先进芯片出口管制,仍是全球AI数据中心实际落地的关键制约因素。