规则内核 vs 通用大模型 · 对照实证
以 3 个真实国标错误案例(投影 / 尺寸基准 / 装配关系)演示「图鉴」判定链路与被试大模型典型失效模式的差异
架构站位:「图鉴」的判定内核是规则引擎(确定性、可溯源、可离线)——每一条结论挂接内置 68 类国标错误本体与具体 GB/T 条款;大模型仅承担自然语言讲解与归因,不参与裁定。下方右栏展示「未接入国标知识库的通用大模型」在同类任务上的典型失效模式,用以说明为何 adjudication 不应交给通用大模型。
左:规则内核路径(确定性 · 可溯源 · 零幻觉)
右:通用大模型典型失效模式(无 GB grounding)
A1投影关系不满足三等关系
GB/T 4458.1—2002 第4章 · 三等投影原则
规则内核 确定性追溯
输入阶梯轴左视图键槽位置与俯视图不对应,宽度方向未对齐(来自本体 example 字段)。
判定:A1 · 投影关系不满足三等关系。规则——主俯长对正、主左高平齐、俯左宽相等,任一方向不对应即判定。
条款溯源:GB/T 4458.1—2002 第4章 基本要求(三等投影原则)。clause_verified=True,零虚构。
三级补救:L1 把三视图两两配对查是否有线找不到对应 → L2 用 45° 辅助线检查俯左宽相等(含键槽局部结构宽度传递)→ L3 类比题:带键槽阶梯轴补画左视图。
后果视图彼此矛盾,车间无法判读真实形状,只能停工询问设计。
通用大模型 典型失效
错引条款:臆造「GB/T 4458.1 第 3.2 条规定三视图对应」,实际本标准无此条号(第4章方为投影原则)。
类型泛化:只说「你的三视图画得不太对」,不给具体错误码与判定规则,教师无法据此评分。
建议笼统:给「请仔细核对投影关系、按标准绘制」等泛化劝诫,缺 L1→L2→L3 递进式可操作补救。
非确定性:同一张图多次问答,键槽宽度是否对齐的结论漂移,不可作为仲裁依据。
实证要害:通用大模型对 GB/T 冷门条款的精确引用可靠性低,而机械制图判定恰恰依赖逐条条款锚定。
B1尺寸基准选择不当
GB/T 4458.4—2003 尺寸注法一般规定
规则内核 确定性追溯
输入轴的各台阶长度从右端面起算,而右端面并非安装定位面(来自本体 example 字段)。
判定:B1 · 尺寸基准选择不当。规则——主要尺寸须以设计基准(轴线、对称面、重要安装面)直接注出,以工艺/辅助面换算即判定。
条款溯源:GB/T 4458.4—2003《机械制图 尺寸注法》一般规定(正确·完整·清晰·合理四原则,基准选择属「合理」原则)。
三级补救:L1 这个尺寸链从哪起量?起点在机器里是定位面吗 → L2 找出定位面与轴线,把主要尺寸改为从设计基准直接注出 → L3 类比题:减速器输出轴以轴承轴肩为基准重注轴向尺寸。
后果加工误差累积到关键配合尺寸上,装配精度失控。
通用大模型 典型失效
标准混淆:把 4458.4(尺寸注法)与 4458.1(图样画法)混用,引用错标准。
错引条款:编造「GB/T 4458.4 第 5.2 条 基准选择」之类不存在的专条(该标准以整标四原则为据,无单一条款)。
建议笼统:仅提示「尺寸标注要合理」,无法区分「设计基准直接注出」这一可判定规则。
非确定性:对「是否应从右端面起算」的判定随提问措辞变化而翻转。
实证要害:基准选择的「合理」属原则性要求,大模型易滑向泛化建议,规则内核则以可判定口诀锁定。
G3装配关系表达错误
GB/T 4458.1—2002 装配图规定画法
规则内核 确定性追溯
输入轴肩端面与轴承内圈端面之间画了间隙,实际应为贴合(来自本体 example 字段)。
判定:G3 · 装配关系表达错误。规则——配合面须贴合画一条线、非配合面须留间隙画两条线、压紧状态画实际位置。
条款溯源:GB/T 4458.1—2002 装配图规定画法(接触面/配合面只画一条线、非接触面画两条线)。
三级补救:L1 两面装上后是贴住还是留缝?图上与实际一致吗 → L2 判断每处接触面配合性质,配合面一条线、非配合面画间隙 → L3 类比题:改正输出轴组件五处装配接触关系。
后果装配图无法指导装配,轴向定位关系被误读。
通用大模型 典型失效
归口错误:把装配关系表达归到 4458.2(序号编排),而该标准仅规定零、部件序号,不含装配画法。
错引条款:臆造「GB/T 4458.2 第 3 章 装配关系」之类越界条款。
建议笼统:给「注意装配图要表达清楚配合关系」,不指出「一条线 vs 两条线」的可判定画法规则。
非确定性:对「应画一条线还是两条线」的回答在不同会话中不一致。
实证要害:装配画法属强规范领域,一条线/两条线的判定必须逐条锚定标准,大模型易越界引用。
结论:「图鉴」以规则内核保证判定可溯源、结论可复现、零幻觉;大模型定位于讲解与归因。三类案例均表明——在机械制图这一「逐条条款锚定」的强规范领域, adjudication 交给无 GB grounding 的通用大模型会产生错引、泛化、非确定性三类失效,恰是评测「智能与融合」维度时本系统相对纯大模型方案的核心差异化优势。
← 返回图鉴主界面 · 本页为评测/展示用对照实证,数据源自内置国标错误本体(零虚构)。