一个「看起来像真的」的数字
「这个配方的反射损耗最小值是多少?」大语言模型会流畅地给出 -31.5 dB 这样的答案。它可能接近文献常见区间,也可能完全偏离你的体系,而你无法分辨:没有训练数据来源,没有适用范围,没有误差估计。
材料研发里的每个数字都可能变成一次真实的实验。云烯的选择是:让大语言模型做它擅长的理解、规划与解释,把关键数值交给本机训练的机器学习与物理模型,并且永远附上适用域与不确定性。
大语言模型从文本中学习「什么样的数字看起来合理」,而不是从你的实验数据中学习「这个体系真实的规律」。直接问它一个性能数值,它会给出一个语气自信、来源不明的答案。
「这个配方的反射损耗最小值是多少?」大语言模型会流畅地给出 -31.5 dB 这样的答案。它可能接近文献常见区间,也可能完全偏离你的体系,而你无法分辨:没有训练数据来源,没有适用范围,没有误差估计。
同样的问题交给本机训练的模型:数值来自你自己的实验数据与物理特征工程,同时给出适用域判断与不确定性。落在适用范围之外的参数会被明确标注,而不是被掩盖成一个光滑的预测值。
这不是「不用大模型」,而是「不让大模型冒充计算器」。两个引擎在同一工作台里协同,边界清清楚楚。
工程上真正危险的从来不是「没有答案」,而是「一个不知道能不能信的答案」。云烯把适用域与不确定性作为预测的一等公民。
每次预测都判断输入参数与训练数据分布的距离。落在适用域之外,界面会明确标注「此结果超出验证范围」,而不是悄悄给出一个外推值。
预测区间与置信说明随数值一起展示,未验证的约束条件不会混入通过名单。实验人员看到的不是一个孤立数字,而是一个可以做决策的判断依据。