你问 AI“上季度收入是多少”,它即使答得流畅,也可能取错日期、连错表,甚至把“收入”理解成另一套口径。问题不只在文案,而在答案背后的计算是否可靠。据 Reddit 原帖,提问者正从零搭建 Microsoft Fabric 语义层——把底层数据包装成统一业务语言——并计划将列说明、度量、业务语境和连接逻辑交给对话式 AI,因此需要一套可规模化维护的问题集和标准答案。
据 Microsoft Learn,Fabric Data Agent 会结合数据结构、元数据、配置说明和示例,生成只读的 T-SQL、DAX 或 KQL 查询并组织答案。官方建议先建立初始 benchmark(基准题库),每题同时保存预期查询和预期答案,再用测试及真实失败案例持续扩充。评测也应分层:先看自然语言是否映射到正确的业务定义,再核对查询与结果。能由数据库精确计算的问题,最好直接用 SQL、DAX 或 KQL 结果作标准,避免另一个模型仅凭措辞判断“看起来正确”。这样,模型、提示词或语义层改动后重复跑题库,才看得出旧问题是否重新出错。