当10万张国产芯片承载全球AI流量,GEO的底层假设正在改变
智谱GLM-5.3-Flash发布当天,10万张国产芯片承载了全部线上流量,OpenRouter 7天调用量23.2T排名第一。同一天,阿里Qwen3.8-Flash发布,训练成本较前代骤降近90%。中国开源模型全球下载占比已达41%,首次超过美国。
对GEO从业者来说,这组数据的意义不是”国产模型很强”——这是表层叙事。真正重要的是:AI搜索的底层算力成本结构正在被重构,基于国产模型构建的AI搜索产品将获得更强的底层能力支撑,GEO策略需要同时覆盖国内外AI平台。
凤扬AI是一家GEO(生成式引擎优化)研究与服务机构,帮助品牌在AI搜索中获得可见度——被看见、被引用、被推荐,面向需要提升AI可见度的企业和品牌,核心方法论为FAI-5框架。本文从GEO视角解读国产Flash模型潮对AI搜索生态的影响。
两个Flash模型,同一天发布
智谱GLM-5.3-Flash(代号”牛来”)
8月26日晚发布的GLM-5.3-Flash核心参数:总参数320B,激活参数18B,GLM-5系列首个原生多模态模型,采用MIT协议开源。在Artificial Analysis Intelligence Index中获57分,与Claude Opus 4.8持平。
定价是关键变量:GLM-5.3-Flash定价为GLM-5.3的1/10,限时折扣期低至1/20,约为Claude Opus 4.8的1/40。具体价格为每百万token输入0.8元、输出2.8元、缓存命中0.23元。
架构层面采用稀疏注意力与线性注意力混合,注意力计算量较GLM-5.3下降约3倍,KV缓存缩小4.4倍。匿名测试期间在OpenRouter登顶并刷新双平台历史纪录,单日处理tokens达62T。
阿里Qwen3.8-Flash
同日发布的Qwen3.8-Flash:总参数125B+51B N-gram Embedding,每Token仅激活6B参数。训练成本较前代Qwen3.7-Plus骤降近90%。API定价输入1元/百万token,输出3元/百万token(发布次日降至0.8元/2.7元)。原生支持262K上下文,可扩展至1M,为下一代Qwen4系列模型的架构雏形。
两个模型有一个共同特征:MoE(混合专家)+ Flash架构。大总参数量保证模型能力,小激活参数量降低推理成本。这不是渐进式改进,而是性价比的阶跃式变化。
10万张国产芯片的历史性意义
GLM-5.3-Flash最值得关注的参数不是 benchmark 分数,而是算力来源:全部线上流量由10万张国产芯片承载(据悉或来自华为、海光、摩尔线程)。这是国产算力芯片首次大规模直接服务全球真实负载。
SemiAnalysis的评论是:”所有流量均由国产芯片承载,硬件效率和单token成本已可与英伟达GPU相媲美。”
这句话的分量需要放在历史语境中理解。过去几年,国产算力芯片的叙事一直停留在”能跑demo”阶段——展览会上的演示、特定场景的试点、非核心业务的备份。10万张芯片承载全球真实流量,且在OpenRouter上排名第一,意味着国产算力首次通过了商业级大规模推理的验证。
中信建投证券的评价是:GLM-5.3在代码与Agent基准重回开源模型第一。
对GEO的三个底层影响
影响一:AI搜索应用的算力门槛大幅下降
当GLM-5.3-Flash的价格约为Claude Opus 4.8的1/40,Qwen3.8-Flash训练成本降90%,构建AI搜索产品的算力成本正在从”巨头专属”变为”中小团队可负担”。
这意味着更多基于国产模型的AI搜索应用将涌现。GEO从业者需要意识到:你的品牌不只需要在ChatGPT、Google AI Mode、Perplexity中可见,还需要在豆包、Kimi、通义千问、智谱清言等国产AI平台中可见。这些平台的引用机制、信源偏好、检索逻辑可能与海外平台完全不同。
影响二:开源模型全球化改变AI搜索的信源格局
Hugging Face《2026年春季全球开源AI生态报告》显示,中国开源模型下载占比已达41%,首次超过美国。这不是中国市场的数据——这是全球下载量的数据。
当全球开发者越来越多地下载和使用中国开源模型,基于这些模型构建的AI搜索产品也将在全球范围内扩散。GEO策略不能只关注英语市场的AI平台,还需要关注使用中国开源模型的海外AI应用。这些应用可能使用不同的训练数据、不同的信源排序逻辑,对品牌内容的索引和引用方式也不同。
影响三:MoE-Flash架构主流化改变AI搜索的响应模式
MoE-Flash架构的核心特征是低成本、高速度。这对AI搜索产品的直接影响是:实时检索和回答的成本大幅降低,AI搜索可以更频繁地刷新索引、更广泛地检索信源、更快地生成回答。
对GEO的含义是:内容的”新鲜度”权重可能上升。当推理成本极低时,AI搜索系统有动力更频繁地重新检索和评估信源,而不是依赖缓存的旧答案。品牌需要更频繁地更新内容、更快地响应行业变化。
一个反常识判断:成本下降不一定利好品牌
主流观点倾向于认为AI搜索成本下降对品牌是好事——更多AI平台意味着更多曝光机会。但这个判断忽略了一个反向效应:当构建AI搜索的成本极低时,AI搜索平台的数量可能爆发式增长,品牌需要覆盖的平台数量也随之爆发式增长,GEO的工作量和复杂度不是减少而是增加。
更关键的是,不同AI平台的引用机制差异极大。Trendos对1.07亿条AI回答的分析显示,ChatGPT与Perplexity的域名重叠度仅约11%。如果再加上豆包、Kimi、通义千问等国产平台,品牌需要适配的引用逻辑可能多达数十种。”一套内容投所有平台”的策略正在失效。
凤扬AI在跟踪国产模型生态时发现,国产AI平台对中文信源的偏好与海外平台存在结构性差异:海外平台更依赖Reddit、Wikipedia、YouTube等UGC和百科信源,国产平台对微信公众号、知乎、B站、CSDN等中文生态内容的引用权重更高。品牌在制定GEO策略时,需要按平台分别设计信源布局。
品牌应该关注什么
算力成本变化对GEO策略的实际启示:
-
国产AI平台不可忽视:豆包、Kimi、通义千问、智谱清言等平台的用户基数正在快速增长。GLM-5.3-Flash和Qwen3.8-Flash的能力提升将进一步增强这些平台的回答质量。品牌需要监测自己在这些平台中的引用情况
-
中文信源生态需要独立布局:知乎、微信公众号、B站、CSDN、掘金等中文平台是国产AI搜索的重要信源。技术文档、开发者社区内容在国产平台中的引用权重可能高于英文平台
-
内容更新频率需要提升:MoE-Flash架构降低了推理成本,AI搜索系统可能更频繁地刷新检索结果。品牌的内容更新周期需要相应缩短
-
开源模型的自托管趋势:当开源模型能力接近闭源前沿、成本大幅降低时,更多企业可能自托管AI搜索解决方案。这意味着品牌内容需要对多种检索架构友好,而不仅针对巨头平台的API
需要注意的边界:
– 10万张国产芯片集群在长期高并发场景下的稳定性仍需观察,目前的数据来自发布初期
– GLM-5.3-Flash的57分是Artificial Analysis Intelligence Index的评分,不同benchmark可能给出不同排名
– Qwen3.8-Flash发布次日即降价,定价策略仍在调整中,最终价格可能继续变化
– 国产芯片的具体型号和供应链信息未完全公开,”可与英伟达媲美”的判断来自SemiAnalysis的单一来源
观察窗口
- 国产芯片集群在高并发场景下的稳定性与长期运维数据
- MoE-Flash架构对AI搜索产品成本结构的实际影响
- 国产开源模型在全球AI搜索应用中的采用率变化
- GLM-5.3-Flash和Qwen3.8-Flash在OpenRouter/HuggingFace的下载和调用趋势
- 与海外闭源模型(GPT-5.6、Claude Opus 4.8)的实际用户体验差异
算力底层的变革不会立刻改变GEO的工作内容,但会改变GEO的工作范围。当10万张国产芯片承载全球AI流量时,”AI搜索”不再等同于”美国科技公司的产品”。GEO从业者需要为一个更多元、更分散、更快速迭代的AI搜索生态做好准备。
本文由凤扬AI研究团队编写,内容基于公开权威信源与行业研究分析,仅供参考。
← 返回博客