Technology Philosophy

为什么我们不让人工智能直接「编数字」

材料研发里的每个数字都可能变成一次真实的实验。云烯的选择是:让大语言模型做它擅长的理解、规划与解释,把关键数值交给本机训练的机器学习与物理模型,并且永远附上适用域与不确定性。

The Problem

大语言模型不是材料模型

大语言模型从文本中学习「什么样的数字看起来合理」,而不是从你的实验数据中学习「这个体系真实的规律」。直接问它一个性能数值,它会给出一个语气自信、来源不明的答案。

直接问 LLM

一个「看起来像真的」的数字

「这个配方的反射损耗最小值是多少?」大语言模型会流畅地给出 -31.5 dB 这样的答案。它可能接近文献常见区间,也可能完全偏离你的体系,而你无法分辨:没有训练数据来源,没有适用范围,没有误差估计。

问本地模型

一个有来历、有边界的数字

同样的问题交给本机训练的模型:数值来自你自己的实验数据与物理特征工程,同时给出适用域判断与不确定性。落在适用范围之外的参数会被明确标注,而不是被掩盖成一个光滑的预测值。

Dual Engine

双引擎分工:谁擅长,谁上场

这不是「不用大模型」,而是「不让大模型冒充计算器」。两个引擎在同一工作台里协同,边界清清楚楚。

Engine A

大语言模型:理解与规划

  • 听懂自然语言描述的研发任务
  • 拆解步骤、编排 9 个领域 Agent
  • 解释结果、撰写报告、整理文献线索
Engine B

本地模型:关键数值预测

  • 本机训练的多算法集成模型
  • 62 维材料特征工程,含 21 维物理特征
  • 留出法独立校验,验证策略写进模型卡
协作方式:大语言模型负责理解你的目标并调用本地工具完成计算,再把结果解释给你。它接触任务与结论,但不代替本地模型产生数值。
0材料特征工程体系,覆盖成分、工艺与结构
0物理特征,把领域知识写进模型输入
0+工程化 Agent 能力,真实接入工作流
0%数值计算在本机完成,不出你的设备
Honest Prediction

每个预测,都带着自己的边界

工程上真正危险的从来不是「没有答案」,而是「一个不知道能不能信的答案」。云烯把适用域与不确定性作为预测的一等公民。

01

适用域:模型知道自己的能力圈

每次预测都判断输入参数与训练数据分布的距离。落在适用域之外,界面会明确标注「此结果超出验证范围」,而不是悄悄给出一个外推值。

02

不确定性:误差是结论的一部分

预测区间与置信说明随数值一起展示,未验证的约束条件不会混入通过名单。实验人员看到的不是一个孤立数字,而是一个可以做决策的判断依据。

See It Work

打开在线体验改一组参数,亲眼看适用域如何工作

官网模拟台完整还原桌面版的预测交互:修改参数、查看预测值、适用域与不确定性说明。真实训练能力在桌面版中提供。