MEETING MINUTES · 最高保密级

工研院会谈前与奶昔

会谈前的技术底牌梳理:竞争格局怎么划、差异化壁垒到底在哪、哪些能对外讲哪些绝对不能讲、以及对外沟通的双轨策略。

日期:2026-08-27 时长:24 分 26 秒 参与人:Gary(对外)· 奶昔(技术) 形式:语音通话,Gary 录音
含团队背景与商业机密 · 仅限本人 · 严禁转发

00 · SUMMARY本次通话解决了什么

Gary 在会谈前把「别人会怎么问、我该怎么答」逐条过了一遍。核心产出是一条差异化逻辑,以及一份「哪些话能说、哪些绝对不能说」的清单。

一句话结论

三家主要对手(无问芯穹、硅基流动、趋境科技)本质上都是清华系教授带学生创业,而我们是芯片原厂团队出来的——对国产卡的了解不是一个量级。但这条理由属于内部逻辑,对外不能这么讲(§2)。对外要讲的是另一套(§6)。

① 对手名单已收敛

同层对手就三家:无问芯穹、硅基流动、趋境科技。园区内的基元律动与 EvoKernel 不在同一层,不构成竞争。

② 壁垒来源已明确

不在「会不会做算子优化」——那是所有人都在做的事;在于对国产卡的了解深度,而这来自原厂经历。

③ 沟通口径已分轨

对投资人讲「国产卡上的 infra 更值钱」,对业务方只讲能不能跑出好 token——业务方不 care 国产不国产。

④ 会谈基调已定

第一次不聊这么技术。另外奶昔反复强调:团队背景、任何想法与反馈,一个字都不能漏。

关于本纪要的两点说明:一、语音转写的发言人标签在 20:30 前后发生对调,本纪要按内容归属而非按标签;二、原文有大量专有名词转写错误(「苍穹」「曲靖科技」「三组」「英孚尔」等),已逐一核实修正,对照见附录。

01 · LANDSCAPE竞争格局:谁是对手,谁不是

1.1 同层对手就三家

Gary 问「做推理的国内也有几家,你们和他们的区别是什么」,奶昔当场点名,名单收敛得很干净:

公司背景(会后核实)奶昔的判断
无问芯穹清华 汪玉教授体系。汪玉原为清华电子系院长口述「他们本质上都是清华系出来创业的,教授带学生出来创业的。他们对芯片原厂的优化能力,肯定没有芯片原厂的团队出来的强。」
硅基流动袁进辉,清华博士,OneFlow 深度学习框架创始人
趋境科技清华计算机系 武永卫教授(IEEE Fellow)发起,CEO 艾智远为武永卫门下清华博士;与清华 KVCache.AI 团队(章明星,Kimi 的 Mooncake 架构作者)深度合作已核实
这条判断会后已被独立验证

三家的清华教授源头都对得上:无问芯穹—汪玉、趋境科技—武永卫、硅基流动—袁进辉(清华博士)。奶昔在通话中脱口而出的这条归纳是准确的,不是印象。

1.2 园区内那两家不算对手

Gary 特别问了工研院项目库里的两家——因为「他们肯定会问:我下面也有做这个的,你们跟他们有啥区别」。

基元律动 · 不同层

奶昔原话:「他们根本就不算(对手)。基元律动做的是 Agent 那一层。」

会后核实:创始人王云鹤,原华为诺亚方舟实验室主任、盘古大模型负责人;CTO 韩凯,前诺亚方舟首席研究员。产品 OpenSquilla 是 Agent Harness(路由 + 记忆 + 沙箱),GitHub 超 6,600 Stars,估值约 1 亿美元已核实。确实在 Agent 调度层,不在推理基础设施层。

EvoKernel · 只占一小块

奶昔原话:「算子自动优化——这只是推理优化整体技术栈里的一小部分。」

Gary 的理解得到确认:「它只针对最底层那个算子层,精度对齐和框架生态之类的不一定它做。」
奶昔补充:「算子那一层是关键的,但它不是整个系统表现好不好的决定性的一层。」

这里有一句可以直接带进会谈的话

奶昔:「不管是什么样的优化,你推理也好训练也好,它最后肯定是一个系统级全量的优化。到最后落实肯定是算子去跑,中间还有 CPU 的调度——但算子只是最后那一层。」

Gary 的复述已经很准:「它本来有五六层,每一层都得优化好,最后的结果才好。」被问到与 EvoKernel 的区别时,这就是标准答案——不否定对方,只指出层次。

02 · THE MOAT差异化壁垒到底在哪

这是 Gary 最想问清的一件事,也是本次通话最有价值的部分。他的疑问很尖锐:既然大家做的都是同样几件事,门槛在哪?

2.1 Gary 提出的质疑

Gary 原话(已去口语冗余)

「我们这两天也跟一些投资人聊,做训练的确实比做推理稀缺。但推理这块,大家能做的都是算子优化、对齐精度、提高 MFU 使用率——都是这样的。那技术门槛到底在哪里?」

奶昔的回答很直接:「就是这些东西啊,这些东西都是这样做的呀。就看谁做得好。」

Gary 顺着推出结论:「你们的优势就是,你们对国产卡的了解比现在那些公司肯定更好,因为你们是原厂的。」奶昔确认:「对啊,这个理由还不够成立吗。」

2.2 但这条理由不能对外讲

明确的禁令

Gary 追问还有没有别的理由(「我们把理由一两句话讲清楚会更有效」),奶昔的回应是:

「不不不,你讲理由你还不能讲这个。」

Gary 表示理解:「我知道不能讲,但我自己得知道是什么情况。」

所以「原厂背景」是内部认知,不是对外话术。对外怎么讲见 §6。

2.3 两条最硬的证据——也是最不能说的

🔒 绝密 · 任何场合不得提及

奶昔在通话中说出了两件事,作为「我们比他们强」的实证。这两条是本纪要保密级别最高的内容,涉及第三方商业关系,对外泄露的后果不可控。

  • 关于硅基流动:「他们的算子很多都是我们帮着写的。」
  • 关于无问芯穹:其底层的某一层「我们也是共建的」。

使用建议:仅用于内部判断对手成色与自身定位,不写进任何对外材料,不在任何有第三方在场的场合提及。本纪要保留这两条是因为它们决定了我们对竞争格局的判断可信度——如果这是真的,那么「他们不如我们」不是自我评价,而是事实。

2.4 一条可以对外讲的硬经验

Gary 问了一个尖锐问题:「华为不是不让用英伟达的卡吗?那你们对英伟达的优化经验多不多?」

奶昔的回答——这条可以对外讲

「多。为什么多?因为我们每一次去 POC 的时候,别人都会让我们跟英伟达去比。所以英伟达上的优化我们得懂,我们才能做得比它更好。」

Gary 的追加确认:「这个经验就可以内推到其他国产卡上。」奶昔认可。

这条的价值在于:它既证明了我们同时懂两边,又不需要点明原厂身份。表述可以处理成「我们的团队长期在国产加速器与 NVIDIA 平台做对照测试,两边的优化都熟」,不涉及具体单位。

03 · WHY DOMESTIC为什么推理要用国产卡

Gary 问:「推理为什么不能用英伟达?」这一节的答案里,有一条此前没有出现在任何公开材料中的产业机制。

3.1 先说需求侧

奶昔:「英伟达可以上,但你国内英伟达能拿到多少?」

关于推理与训练的卡需求对比:「推理用的卡比训练更多。推理是海量需求——需求量大、场景多,比训练多多了。」

Gary 提出反问:目前 MiniMax、DeepSeek 这些主流玩家推理用的都是英伟达;中国的 token 调用量占全球三到四成,基本也都跑在英伟达卡上。「除非 token 需求再爆发十倍,英伟达卡不够了,才会用到国产卡?」

奶昔的回应把问题拉回供给侧:「NV 进中国进不来,或者说受限。这是整个国产替代的大背景。」

3.2 ⭐ 采购配比机制:这条最有价值

奶昔口述的产业机制(原话整理)

「所有的算力中心它都是有配比的。

首先,B 系列进国内这件事,基本上很难干。

然后你如果想正儿八经采购上一代的 H 系列卡,你必须要按一定的比例去配国产的卡——比如你采购 1 个亿的 H200,就一定要配比如 2 个亿的国产卡。」

Gary 立刻接上了因果:「所以这也就是国产卡排期排到 2028 年都已经被订完的原因。」

奶昔确认,并给出了本次通话最关键的一个判断:

「纸面算力」

「国产卡的产能一直是被锁住的。但这些东西现在都是纸面算力——就是放在那里的算力,弄不起来的算力。」

这条直接构成我们的商业逻辑:卡已经被买走了、堆在那里,但用不起来。这不是「说服客户买国产卡」的问题,而是「客户已经被迫持有大量国产卡,需要有人让它跑起来」的问题——后者是刚需,前者是销售。

3.3 叙事角度:Gary 提出了更好的框架

Gary:「我觉得这个思路会更好——不是国产替代,而是中国现在大力投资算力,你要怎么用起来的问题。」

奶昔认可这个方向,并指出「国产替代」这个说法已经讲烂了,不用讲。落点应该是:「中国建了这么多智算中心,怎么把它们用起来。」

这个转向很重要:从「政治正确的替代叙事」转成「已投资产的效率问题」,后者对园区、对企业、对财务口都成立,而且不需要对方认同任何立场。

04 · THE STACK推理优化的技术栈与量化标准

4.1 奶昔口述的分层(自上而下)

被问到「推理优化到底包含什么」时,奶昔给出了一条完整链路:

层做什么
① 请求层query 的优化
② 批处理层query 打 batch
③ 阶段配比prefill 与 decode 怎么配比
④ 并行策略到底用什么并行策略
⑤ 算子层算子到底写得好不好
⑥ 异构部署PD 要不要异构——Prefill 用国产卡、Decode 用 NVIDIA 卡,要不要这么做
第 ⑥ 层值得单独拿出来

「P 用国产卡、D 用 NV 卡」是一个我们此前没有写进提案的具体方案。Prefill 算力受限、Decode 带宽受限,两阶段的硬件诉求本来就不同——把它们拆到不同型号的卡上,理论上可以同时用好两边的长处,也天然契合「必须按配比持有国产卡」的客户现实(§3.2)。

建议:这条作为技术方案的差异化亮点补进提案第 6 章。

4.2 量化标准:Gary 口误,奶昔纠正

Gary 认为「谁做得好不好其实是很容易量化的事情」,并提出用 MFU 衡量。奶昔的纠正很值得记:

对话还原

Gary:「最后量化的是 MFU。」

奶昔:「MFU 是啥?……不是这个。推理的话,你是固定 SLA 下,你的单卡产出的 token 的效率。」

奶昔补充:「MFU 只是其中一个『利用得好不好』的指标,不是最终决定性的。」

Gary 自己收敛出了对外表述:「对推理来说,就是在固定 SLA 之下,我产出的 token 是最快的。」奶昔认可。

4.3 但采购方其实不看这些

奶昔特别提醒了采购视角与技术视角的差异:

这段直接决定第一次会谈讲什么

「从采购方的视角来看,他们大概能知道就行了,甚至都不用知道。他们买 API 能用就行。

那些性能指标其实都还好,你到最后其实看的是:你提供出来的这个东西,一方面是质量问题,另一方面是速度问题。

TTFT 小于多少这类技术指标,那是你到最后签商务合同的时候才写的。

他们最后看的是一个大的逻辑:我花了这么多钱,能不能满足我这么多企业的诉求。」

05 · RIVALS对两家头部对手的实况判断

奶昔自述与这几家「都熟得一批」,给出的判断带有明显的一线信息含量。这一节属内部判断,对外不宜直接引用。

5.1 无问芯穹

5.2 一个关于「故事与动作不一致」的判断

🔒 内部判断 · 不可对外

奶昔关于无问芯穹与硅基流动的共同判断:

「他们讲的故事是『国产算力用不好』这个故事,但他们实际做的动作,是下面用了很多英伟达的卡。」

Gary 的复述:「也就是说虽然讲的是国产的故事,实际上还是在英伟达的卡上做动作,因为国产实在太难优化了。」奶昔确认:「对,你看他实际的动作就行了。还是以 GPU 搞营收为主,国产卡是为辅的。」

这条如果成立,是我方最锋利的差异化——但它是对第三方经营策略的指控,没有公开证据支撑,对外讲会有风险。建议只作为内部判断,用来指导我们把资源押在哪一侧。

5.3 为什么国产卡难:奶昔的技术解释

「国产卡上面的坑实在是太多了。我们团队搞了十年这个事儿了。」

Gary 的理解得到确认:「你不在那个体系内,好多坑他的思维角度都不会想到。」

机理解释(原话整理,术语已修正)

「GPU 和 NPU 是同一级别的。但你去理解一下为什么现在要做堆叠——说白了就是我们的制程不如人家,硬件的复杂度因此比 GPU 高很多。

而 GPU 上面做软件优化就比较简单,再加上它上面的 CUDA 生态很好。

所以在 GPU 上做性能优化是有价值的,而且也很贵。GPU 上的 infra 很值钱,国产卡上的 infra 要更值钱——结合中国现在的形势。」

Gary 用海外估值佐证:「国外做推理的,在 GPU 已经这么成熟的情况下,估值也几十亿美金。」

06 · DUAL TRACK双轨沟通策略

这是本次通话标题所指的核心产出:同一件事,对投资人和对业务方要用两套完全不同的讲法。

 对投资人对业务方(含工研院)
讲什么 「GPU 上的 infra 很值钱,国产卡上的 infra 更值钱」——国产卡难做、坑多、能做的人极少,这个位置的稀缺性本身就是价值 「你花的钱能不能跑出足够好的 token」——质量与速度,能不能满足你下面这些企业的诉求
为什么这么分 奶昔:「这个东西本质上跟投资人讲,比跟业务方讲更性感一点。」 奶昔:「业务方有可能不 care 这件事情,甚至都不关心。你只要能够跑出来好的 token 就行了。」
国产/非国产 是核心叙事的一部分 不强调。Gary 的建议被采纳:「按纯业务逻辑讲,说我们能做得更好」
奶昔说了一句很坦白的话,值得记住

「有一说一说实话:如果我有 1 万张 GPU,我肯定用 GPU 给他干。为了咱们国家的国产算力产业,那我就用 NPU、就用国产卡给他讲。」

这句话的含义是:国产卡不是技术最优解,是约束条件下的最优解。理解这一点,对外表述才不会用力过猛——我们卖的不是「国产卡更好」,而是「你手上这些卡,我能让它跑起来」(呼应 §3.2 的纸面算力)。

07 · EXECUTION会谈执行要点与保密纪律

7.1 第一次会谈的基调

奶昔的明确指示

「你第一把肯定不用聊得这么技术。」

Gary 的回应:「不用聊这么技术,我现在大概知道,我自己得分清,我知道以后再说。」

对照提案第 11 章的会谈议程设计——两边结论一致:技术只在被追问时展开,第一次会谈的目标是拿到口径与约定下一步,不是证明技术实力。

7.2 必然会被问到的一题

Gary 明确预判:「他们肯定会问——我下面也有做这个的,你们跟他们有啥区别?」(指基元律动与 EvoKernel)

奶昔一度反问「你为什么还要跟他下面的那些企业去比呢」,但 Gary 坚持这一定会被问到。标准答案见 §1.2:不否定对方,只指出层次——Agent 层、算子工具层、端到端推理服务层,是三件事。

7.3 保密纪律(奶昔反复强调,共三次)

🔒 原话
  • 「我们的背景信息你别漏。」
  • 「什么想法、反馈,什么事都不要说。」
  • 「你一定要记得,不要漏我们的所有的东西。」
  • Gary 的回应:「保密比做事还重要。」

具体清单:团队的原厂背景、与第三方的技术合作关系(§2.3)、对同业的判断(§5.2)、内部想法与会后反馈——全部不可外泄。

7.4 关于工研院的关系网络

本节按参与人意愿做了删节

通话最后触及工研院方面的人脉与利益关系,奶昔谈到关键人物之间的信任基础时主动中止并要求停止录音(「这些话都不能再说了,因为我在录音呢」),Gary 随即停止。

基于参与人当场明确表达的意愿,本纪要不记录该段的人名与具体事由,仅保留一条可用于判断的通用观察:

该网络中的信任关系建立在长期利益绑定之上,而非学历、履历这类背景认同。含义是:进入这类关系网络,靠的是能不能让对方合法合规地一起把蛋糕做大,而不是自证实力。

如需完整记录,请自行补记——原始音频即将按你的指示删除,删除前请确认此处是否需要保留更多细节。

08 · ACTIONS待办与待核

8.1 待办

#事项来源
1把「PD 异构」写进提案技术方案——Prefill 用国产卡、Decode 用 NVIDIA 卡的混合部署,是本次新增的差异化点,且与「客户被迫持有国产卡」的现实高度契合§4.1
2把「纸面算力」作为核心叙事替换「国产替代」——从「该不该用国产卡」转成「已经买了的卡怎么跑起来」§3.2 / §3.3
3准备好「与园区内两家的区别」的标准答法,一句话版本:Agent 层、算子工具层、端到端推理服务层,是三件事§1.2 / §7.2
4把「英伟达对照 POC 经验」处理成不涉身份的表述,作为可对外的能力证明§2.4
5更新提案第 13 章基元律动条目:补上王云鹤(原华为诺亚方舟主任、盘古大模型负责人)、CTO 韩凯、估值 1 亿美元;新增趋境科技为同层对手会后核实

8.2 待核

事项状态
H 系列采购必须按比例配国产卡(1 亿 H200 配约 2 亿国产卡)口述,未见公开文件。若属实是极强的市场论据,值得单独找旁证待核
国产卡排期已排到 2028 年口述,需找公开报道印证待核
汪玉曾任清华电子系院长、其兄长的相关情况口述且涉及个人,建议不予采用
「涛定律」(转写原文)上下文为「制程不如人家所以要做堆叠」,疑为摩尔定律或先进封装相关表述,语音不清存疑
温凯、楚康两位人名转写可能有误,且属敏感内容,本纪要未采用

APPENDIX附录:专有名词勘误表

语音转写对专有名词的错误率很高。下表列出已修正的全部条目,便于回听音频时对照。

转写原文正确说明
苍穹 / 不问空 / 不问星球 / 无问星穹 / 无问西东 / 不问心穷 / 五强无问芯穹同一家公司在通话中出现七种转写,Gary 与奶昔中途还专门确认过读音(「穹苍的穹」)
那轨迹流动 / 归集流动 / 规矩流动硅基流动—
曲靖科技趋境科技Approaching.AI,清华武永卫教授发起已核实
机缘律动 / 机源运动基元律动—
Evo Kernel / EvoConel / 一个空洞 / 一个口头EvoKernel—
王一鹤王云鹤基元律动创始人,原华为诺亚方舟实验室主任、盘古大模型负责人已核实
三组 / 算组 / 扇子 / 科能那一层算子「三组自动优化」=算子自动优化;「扇子」=算子;「科能那一层」=算子(kernel)那一层
大一批和 moe大 EP 和 MoE大规模专家并行
A 的那一层 / A 的股感生Agent 那一层 / Agent 调度—
preview 和 decodeprefill 和 decode预填充与解码
pbatchbatch「query 打 batch」
变形策略并行策略—
MDU / m d uMFUGary 口误,奶昔当场追问「MFU 是啥」并纠正了衡量口径
so / SOL / s o lSLA「固定 SLA 下的单卡 token 产出效率」
ttxtTTFT首字延迟
英孚尔 / 英特尔infra指推理基础设施。注意:通话中的「英特尔」全部指 infra,与 Intel 无关
TALKING / talkingtoken—
退货 / 退货账号推理—
技术站技术栈—
国家生态错国产生态—
商业中心智算中心「中国建了这么多智算中心」
工程院 / 工业院 / 工学院工研院上海交大工业技术创新研究院
华为商城(我们)华为「我们华为每一次去 POC」
涛定律存疑上下文为制程与堆叠,疑为摩尔定律或先进封装相关未定