会谈前的技术底牌梳理:竞争格局怎么划、差异化壁垒到底在哪、哪些能对外讲哪些绝对不能讲、以及对外沟通的双轨策略。
Gary 在会谈前把「别人会怎么问、我该怎么答」逐条过了一遍。核心产出是一条差异化逻辑,以及一份「哪些话能说、哪些绝对不能说」的清单。
三家主要对手(无问芯穹、硅基流动、趋境科技)本质上都是清华系教授带学生创业,而我们是芯片原厂团队出来的——对国产卡的了解不是一个量级。但这条理由属于内部逻辑,对外不能这么讲(§2)。对外要讲的是另一套(§6)。
同层对手就三家:无问芯穹、硅基流动、趋境科技。园区内的基元律动与 EvoKernel 不在同一层,不构成竞争。
不在「会不会做算子优化」——那是所有人都在做的事;在于对国产卡的了解深度,而这来自原厂经历。
对投资人讲「国产卡上的 infra 更值钱」,对业务方只讲能不能跑出好 token——业务方不 care 国产不国产。
第一次不聊这么技术。另外奶昔反复强调:团队背景、任何想法与反馈,一个字都不能漏。
关于本纪要的两点说明:一、语音转写的发言人标签在 20:30 前后发生对调,本纪要按内容归属而非按标签;二、原文有大量专有名词转写错误(「苍穹」「曲靖科技」「三组」「英孚尔」等),已逐一核实修正,对照见附录。
Gary 问「做推理的国内也有几家,你们和他们的区别是什么」,奶昔当场点名,名单收敛得很干净:
| 公司 | 背景(会后核实) | 奶昔的判断 |
|---|---|---|
| 无问芯穹 | 清华 汪玉教授体系。汪玉原为清华电子系院长口述 | 「他们本质上都是清华系出来创业的,教授带学生出来创业的。他们对芯片原厂的优化能力,肯定没有芯片原厂的团队出来的强。」 |
| 硅基流动 | 袁进辉,清华博士,OneFlow 深度学习框架创始人 | |
| 趋境科技 | 清华计算机系 武永卫教授(IEEE Fellow)发起,CEO 艾智远为武永卫门下清华博士;与清华 KVCache.AI 团队(章明星,Kimi 的 Mooncake 架构作者)深度合作已核实 |
三家的清华教授源头都对得上:无问芯穹—汪玉、趋境科技—武永卫、硅基流动—袁进辉(清华博士)。奶昔在通话中脱口而出的这条归纳是准确的,不是印象。
Gary 特别问了工研院项目库里的两家——因为「他们肯定会问:我下面也有做这个的,你们跟他们有啥区别」。
奶昔原话:「他们根本就不算(对手)。基元律动做的是 Agent 那一层。」
会后核实:创始人王云鹤,原华为诺亚方舟实验室主任、盘古大模型负责人;CTO 韩凯,前诺亚方舟首席研究员。产品 OpenSquilla 是 Agent Harness(路由 + 记忆 + 沙箱),GitHub 超 6,600 Stars,估值约 1 亿美元已核实。确实在 Agent 调度层,不在推理基础设施层。
奶昔原话:「算子自动优化——这只是推理优化整体技术栈里的一小部分。」
Gary 的理解得到确认:「它只针对最底层那个算子层,精度对齐和框架生态之类的不一定它做。」
奶昔补充:「算子那一层是关键的,但它不是整个系统表现好不好的决定性的一层。」
奶昔:「不管是什么样的优化,你推理也好训练也好,它最后肯定是一个系统级全量的优化。到最后落实肯定是算子去跑,中间还有 CPU 的调度——但算子只是最后那一层。」
Gary 的复述已经很准:「它本来有五六层,每一层都得优化好,最后的结果才好。」被问到与 EvoKernel 的区别时,这就是标准答案——不否定对方,只指出层次。
这是 Gary 最想问清的一件事,也是本次通话最有价值的部分。他的疑问很尖锐:既然大家做的都是同样几件事,门槛在哪?
「我们这两天也跟一些投资人聊,做训练的确实比做推理稀缺。但推理这块,大家能做的都是算子优化、对齐精度、提高 MFU 使用率——都是这样的。那技术门槛到底在哪里?」
奶昔的回答很直接:「就是这些东西啊,这些东西都是这样做的呀。就看谁做得好。」
Gary 顺着推出结论:「你们的优势就是,你们对国产卡的了解比现在那些公司肯定更好,因为你们是原厂的。」奶昔确认:「对啊,这个理由还不够成立吗。」
Gary 追问还有没有别的理由(「我们把理由一两句话讲清楚会更有效」),奶昔的回应是:
「不不不,你讲理由你还不能讲这个。」
Gary 表示理解:「我知道不能讲,但我自己得知道是什么情况。」
所以「原厂背景」是内部认知,不是对外话术。对外怎么讲见 §6。
奶昔在通话中说出了两件事,作为「我们比他们强」的实证。这两条是本纪要保密级别最高的内容,涉及第三方商业关系,对外泄露的后果不可控。
使用建议:仅用于内部判断对手成色与自身定位,不写进任何对外材料,不在任何有第三方在场的场合提及。本纪要保留这两条是因为它们决定了我们对竞争格局的判断可信度——如果这是真的,那么「他们不如我们」不是自我评价,而是事实。
Gary 问了一个尖锐问题:「华为不是不让用英伟达的卡吗?那你们对英伟达的优化经验多不多?」
「多。为什么多?因为我们每一次去 POC 的时候,别人都会让我们跟英伟达去比。所以英伟达上的优化我们得懂,我们才能做得比它更好。」
Gary 的追加确认:「这个经验就可以内推到其他国产卡上。」奶昔认可。
这条的价值在于:它既证明了我们同时懂两边,又不需要点明原厂身份。表述可以处理成「我们的团队长期在国产加速器与 NVIDIA 平台做对照测试,两边的优化都熟」,不涉及具体单位。
Gary 问:「推理为什么不能用英伟达?」这一节的答案里,有一条此前没有出现在任何公开材料中的产业机制。
奶昔:「英伟达可以上,但你国内英伟达能拿到多少?」
关于推理与训练的卡需求对比:「推理用的卡比训练更多。推理是海量需求——需求量大、场景多,比训练多多了。」
Gary 提出反问:目前 MiniMax、DeepSeek 这些主流玩家推理用的都是英伟达;中国的 token 调用量占全球三到四成,基本也都跑在英伟达卡上。「除非 token 需求再爆发十倍,英伟达卡不够了,才会用到国产卡?」
奶昔的回应把问题拉回供给侧:「NV 进中国进不来,或者说受限。这是整个国产替代的大背景。」
「所有的算力中心它都是有配比的。
首先,B 系列进国内这件事,基本上很难干。
然后你如果想正儿八经采购上一代的 H 系列卡,你必须要按一定的比例去配国产的卡——比如你采购 1 个亿的 H200,就一定要配比如 2 个亿的国产卡。」
Gary 立刻接上了因果:「所以这也就是国产卡排期排到 2028 年都已经被订完的原因。」
奶昔确认,并给出了本次通话最关键的一个判断:
「国产卡的产能一直是被锁住的。但这些东西现在都是纸面算力——就是放在那里的算力,弄不起来的算力。」
这条直接构成我们的商业逻辑:卡已经被买走了、堆在那里,但用不起来。这不是「说服客户买国产卡」的问题,而是「客户已经被迫持有大量国产卡,需要有人让它跑起来」的问题——后者是刚需,前者是销售。
Gary:「我觉得这个思路会更好——不是国产替代,而是中国现在大力投资算力,你要怎么用起来的问题。」
奶昔认可这个方向,并指出「国产替代」这个说法已经讲烂了,不用讲。落点应该是:「中国建了这么多智算中心,怎么把它们用起来。」
这个转向很重要:从「政治正确的替代叙事」转成「已投资产的效率问题」,后者对园区、对企业、对财务口都成立,而且不需要对方认同任何立场。
被问到「推理优化到底包含什么」时,奶昔给出了一条完整链路:
| 层 | 做什么 |
|---|---|
| ① 请求层 | query 的优化 |
| ② 批处理层 | query 打 batch |
| ③ 阶段配比 | prefill 与 decode 怎么配比 |
| ④ 并行策略 | 到底用什么并行策略 |
| ⑤ 算子层 | 算子到底写得好不好 |
| ⑥ 异构部署 | PD 要不要异构——Prefill 用国产卡、Decode 用 NVIDIA 卡,要不要这么做 |
「P 用国产卡、D 用 NV 卡」是一个我们此前没有写进提案的具体方案。Prefill 算力受限、Decode 带宽受限,两阶段的硬件诉求本来就不同——把它们拆到不同型号的卡上,理论上可以同时用好两边的长处,也天然契合「必须按配比持有国产卡」的客户现实(§3.2)。
建议:这条作为技术方案的差异化亮点补进提案第 6 章。
Gary 认为「谁做得好不好其实是很容易量化的事情」,并提出用 MFU 衡量。奶昔的纠正很值得记:
Gary:「最后量化的是 MFU。」
奶昔:「MFU 是啥?……不是这个。推理的话,你是固定 SLA 下,你的单卡产出的 token 的效率。」
奶昔补充:「MFU 只是其中一个『利用得好不好』的指标,不是最终决定性的。」
Gary 自己收敛出了对外表述:「对推理来说,就是在固定 SLA 之下,我产出的 token 是最快的。」奶昔认可。
奶昔特别提醒了采购视角与技术视角的差异:
「从采购方的视角来看,他们大概能知道就行了,甚至都不用知道。他们买 API 能用就行。
那些性能指标其实都还好,你到最后其实看的是:你提供出来的这个东西,一方面是质量问题,另一方面是速度问题。
TTFT 小于多少这类技术指标,那是你到最后签商务合同的时候才写的。
他们最后看的是一个大的逻辑:我花了这么多钱,能不能满足我这么多企业的诉求。」
奶昔自述与这几家「都熟得一批」,给出的判断带有明显的一线信息含量。这一节属内部判断,对外不宜直接引用。
奶昔关于无问芯穹与硅基流动的共同判断:
「他们讲的故事是『国产算力用不好』这个故事,但他们实际做的动作,是下面用了很多英伟达的卡。」
Gary 的复述:「也就是说虽然讲的是国产的故事,实际上还是在英伟达的卡上做动作,因为国产实在太难优化了。」奶昔确认:「对,你看他实际的动作就行了。还是以 GPU 搞营收为主,国产卡是为辅的。」
这条如果成立,是我方最锋利的差异化——但它是对第三方经营策略的指控,没有公开证据支撑,对外讲会有风险。建议只作为内部判断,用来指导我们把资源押在哪一侧。
「国产卡上面的坑实在是太多了。我们团队搞了十年这个事儿了。」
Gary 的理解得到确认:「你不在那个体系内,好多坑他的思维角度都不会想到。」
「GPU 和 NPU 是同一级别的。但你去理解一下为什么现在要做堆叠——说白了就是我们的制程不如人家,硬件的复杂度因此比 GPU 高很多。
而 GPU 上面做软件优化就比较简单,再加上它上面的 CUDA 生态很好。
所以在 GPU 上做性能优化是有价值的,而且也很贵。GPU 上的 infra 很值钱,国产卡上的 infra 要更值钱——结合中国现在的形势。」
Gary 用海外估值佐证:「国外做推理的,在 GPU 已经这么成熟的情况下,估值也几十亿美金。」
这是本次通话标题所指的核心产出:同一件事,对投资人和对业务方要用两套完全不同的讲法。
| 对投资人 | 对业务方(含工研院) | |
|---|---|---|
| 讲什么 | 「GPU 上的 infra 很值钱,国产卡上的 infra 更值钱」——国产卡难做、坑多、能做的人极少,这个位置的稀缺性本身就是价值 | 「你花的钱能不能跑出足够好的 token」——质量与速度,能不能满足你下面这些企业的诉求 |
| 为什么这么分 | 奶昔:「这个东西本质上跟投资人讲,比跟业务方讲更性感一点。」 | 奶昔:「业务方有可能不 care 这件事情,甚至都不关心。你只要能够跑出来好的 token 就行了。」 |
| 国产/非国产 | 是核心叙事的一部分 | 不强调。Gary 的建议被采纳:「按纯业务逻辑讲,说我们能做得更好」 |
「有一说一说实话:如果我有 1 万张 GPU,我肯定用 GPU 给他干。为了咱们国家的国产算力产业,那我就用 NPU、就用国产卡给他讲。」
这句话的含义是:国产卡不是技术最优解,是约束条件下的最优解。理解这一点,对外表述才不会用力过猛——我们卖的不是「国产卡更好」,而是「你手上这些卡,我能让它跑起来」(呼应 §3.2 的纸面算力)。
「你第一把肯定不用聊得这么技术。」
Gary 的回应:「不用聊这么技术,我现在大概知道,我自己得分清,我知道以后再说。」
对照提案第 11 章的会谈议程设计——两边结论一致:技术只在被追问时展开,第一次会谈的目标是拿到口径与约定下一步,不是证明技术实力。
Gary 明确预判:「他们肯定会问——我下面也有做这个的,你们跟他们有啥区别?」(指基元律动与 EvoKernel)
奶昔一度反问「你为什么还要跟他下面的那些企业去比呢」,但 Gary 坚持这一定会被问到。标准答案见 §1.2:不否定对方,只指出层次——Agent 层、算子工具层、端到端推理服务层,是三件事。
具体清单:团队的原厂背景、与第三方的技术合作关系(§2.3)、对同业的判断(§5.2)、内部想法与会后反馈——全部不可外泄。
通话最后触及工研院方面的人脉与利益关系,奶昔谈到关键人物之间的信任基础时主动中止并要求停止录音(「这些话都不能再说了,因为我在录音呢」),Gary 随即停止。
基于参与人当场明确表达的意愿,本纪要不记录该段的人名与具体事由,仅保留一条可用于判断的通用观察:
该网络中的信任关系建立在长期利益绑定之上,而非学历、履历这类背景认同。含义是:进入这类关系网络,靠的是能不能让对方合法合规地一起把蛋糕做大,而不是自证实力。
如需完整记录,请自行补记——原始音频即将按你的指示删除,删除前请确认此处是否需要保留更多细节。
| # | 事项 | 来源 |
|---|---|---|
| 1 | 把「PD 异构」写进提案技术方案——Prefill 用国产卡、Decode 用 NVIDIA 卡的混合部署,是本次新增的差异化点,且与「客户被迫持有国产卡」的现实高度契合 | §4.1 |
| 2 | 把「纸面算力」作为核心叙事替换「国产替代」——从「该不该用国产卡」转成「已经买了的卡怎么跑起来」 | §3.2 / §3.3 |
| 3 | 准备好「与园区内两家的区别」的标准答法,一句话版本:Agent 层、算子工具层、端到端推理服务层,是三件事 | §1.2 / §7.2 |
| 4 | 把「英伟达对照 POC 经验」处理成不涉身份的表述,作为可对外的能力证明 | §2.4 |
| 5 | 更新提案第 13 章基元律动条目:补上王云鹤(原华为诺亚方舟主任、盘古大模型负责人)、CTO 韩凯、估值 1 亿美元;新增趋境科技为同层对手 | 会后核实 |
| 事项 | 状态 |
|---|---|
| H 系列采购必须按比例配国产卡(1 亿 H200 配约 2 亿国产卡) | 口述,未见公开文件。若属实是极强的市场论据,值得单独找旁证待核 |
| 国产卡排期已排到 2028 年 | 口述,需找公开报道印证待核 |
| 汪玉曾任清华电子系院长、其兄长的相关情况 | 口述且涉及个人,建议不予采用 |
| 「涛定律」(转写原文) | 上下文为「制程不如人家所以要做堆叠」,疑为摩尔定律或先进封装相关表述,语音不清存疑 |
| 温凯、楚康两位人名 | 转写可能有误,且属敏感内容,本纪要未采用 |
语音转写对专有名词的错误率很高。下表列出已修正的全部条目,便于回听音频时对照。
| 转写原文 | 正确 | 说明 |
|---|---|---|
| 苍穹 / 不问空 / 不问星球 / 无问星穹 / 无问西东 / 不问心穷 / 五强 | 无问芯穹 | 同一家公司在通话中出现七种转写,Gary 与奶昔中途还专门确认过读音(「穹苍的穹」) |
| 那轨迹流动 / 归集流动 / 规矩流动 | 硅基流动 | — |
| 曲靖科技 | 趋境科技 | Approaching.AI,清华武永卫教授发起已核实 |
| 机缘律动 / 机源运动 | 基元律动 | — |
| Evo Kernel / EvoConel / 一个空洞 / 一个口头 | EvoKernel | — |
| 王一鹤 | 王云鹤 | 基元律动创始人,原华为诺亚方舟实验室主任、盘古大模型负责人已核实 |
| 三组 / 算组 / 扇子 / 科能那一层 | 算子 | 「三组自动优化」=算子自动优化;「扇子」=算子;「科能那一层」=算子(kernel)那一层 |
| 大一批和 moe | 大 EP 和 MoE | 大规模专家并行 |
| A 的那一层 / A 的股感生 | Agent 那一层 / Agent 调度 | — |
| preview 和 decode | prefill 和 decode | 预填充与解码 |
| pbatch | batch | 「query 打 batch」 |
| 变形策略 | 并行策略 | — |
| MDU / m d u | MFU | Gary 口误,奶昔当场追问「MFU 是啥」并纠正了衡量口径 |
| so / SOL / s o l | SLA | 「固定 SLA 下的单卡 token 产出效率」 |
| ttxt | TTFT | 首字延迟 |
| 英孚尔 / 英特尔 | infra | 指推理基础设施。注意:通话中的「英特尔」全部指 infra,与 Intel 无关 |
| TALKING / talking | token | — |
| 退货 / 退货账号 | 推理 | — |
| 技术站 | 技术栈 | — |
| 国家生态错 | 国产生态 | — |
| 商业中心 | 智算中心 | 「中国建了这么多智算中心」 |
| 工程院 / 工业院 / 工学院 | 工研院 | 上海交大工业技术创新研究院 |
| 华为商城 | (我们)华为 | 「我们华为每一次去 POC」 |
| 涛定律 | 存疑 | 上下文为制程与堆叠,疑为摩尔定律或先进封装相关未定 |