物联网 · Verified Case

物联网行业:工业资产运维智能体基准评测

随着工业资产运维从经验驱动走向 AI Agent 自动诊断与协同决策,单纯依赖大模型和零散数据难以准确理解设备结构、故障机理和维修逻辑,因此需要通过本体建模把资产、部件、传感器、告警、故障模式和工单流程沉淀为可推理、可解释、可复用的行业知识体系。

关联本体 AssetOpsBench 工业资产运营本体

案例背景

随着工业资产运维从经验驱动走向 AI Agent 自动诊断与协同决策,单纯依赖大模型和零散数据难以准确理解设备结构、故障机理和维修逻辑,因此需要通过本体建模把资产、部件、传感器、告警、故障模式和工单流程沉淀为可推理、可解释、可复用的行业知识体系。

案例描述

项目基于 IBM Research 开源的 AssetOpsBench 框架进行增强,在原有工业资产运维 AI Agent 评估、任务编排和场景测试能力之上,引入公司自研本体建模技术,对设备层级、功能关系、故障原因、维护动作和业务规则进行统一语义建模。通过本体模型提供的结构化知识约束和关联推理能力,平台不仅能够评估 AI Agent 完成故障诊断、工单分析、维修建议和资产查询等任务的表现,还能提升智能体在复杂工业场景中的知识理解准确性、推理可解释性和跨系统复用能力。

可复现的工业 Agent 基准

围绕 AssetOpsBench 的场景、轨迹和评测报告组织案例内容,展示工业资产运维任务从问题输入、工具调用到结果评分的完整闭环。

MCP 工具链驱动任务执行

基于 IoT、FMSR、工单、TSFM 和振动诊断等领域 MCP 工具,让智能体在资产查询、故障模式、时序建模和工单处理之间按证据行动。

本体增强知识约束与解释

通过 AssetOpsBench 工业资产运营本体统一资产、传感器、遥测、故障、工单、模型、场景和评测语义,帮助评测结果具备可追溯解释。

项目案例

客户面对的问题

工业资产运维任务跨越资产台账、传感器遥测、故障模式、工单记录、时序模型和振动诊断,单轮问答难以覆盖完整操作链路。

AI Agent 如果只依赖大模型生成答案,容易跳过必要工具调用,或在缺少现场证据时补全不存在的资产、传感器、故障原因和维修动作。

不同智能体框架、模型和工具编排方式的输出难以横向比较,需要统一场景、ground truth、轨迹记录和评分口径。

运维专家不仅关心最终答案是否正确,还需要看到 Agent 是否按合理顺序查询数据、验证结果、说明依据并避免幻觉。

时序预测、异常检测、工单生成和振动频谱分析涉及专门工具与运行记录,评测平台需要保留运行证据,便于复评和审计。

工业本体、MCP 工具签名与场景套件需要对齐,否则案例页面只能展示概念,无法形成从领域知识到基准验证的闭环。

项目案例

使用本体前后的变化

使用本体前使用本体后
用零散样例或人工问题测试 Agent,问题来源、数据准备和答案标准不统一。按 AssetOpsBench 场景套件加载 question、manifest 和 groundtruth,用统一 selector 批量运行并形成可复评记录。
只看最终回复,难以判断 Agent 是否查过资产、传感器、故障模式、模型卡或工单数据。保存 trajectory,将 run_id、scenario_id、工具调用、答案和操作指标写入评测报告,支持回放与重新评分。
工具调用缺少领域边界,模型可能混用资产台账、FMEA、时序模型和工单概念。以 IoT、FMSR、WO、TSFM、Vibration 等 MCP 服务划分能力边界,并用本体说明对象关系和规则含义。
评测口径只判断答案像不像,难以覆盖多步任务完成度、数据检索准确性和幻觉风险。结合 static_json 与 LLM-as-Judge 六维 rubric,评价任务完成、数据准确、结果验证、步骤顺序、说明清晰和幻觉控制。
时序模型和特征实验只停留在 notebook 或临时脚本中,后续 Agent 很难复用。通过 TSFM 工具维护模型卡、特征卡、recipe、run record 和 result index,使预测、异常检测和复评结果可追踪。
AssetOpsBench 基准评测闭环展示一个工业运维问题如何进入场景套件,经由智能体和 MCP 工具执行后保存轨迹,并由评分器形成报告。
正在生成关系图…
工业资产运营本体关系展示 AssetOpsBench 工业资产运营本体如何连接资产、传感器、故障、工单、时序建模和评测对象。
正在生成关系图…
从场景运行到复评分发的时序展示研究人员或平台人员执行一组 AssetOpsBench 场景时,各模块之间的关键交互顺序。
正在生成关系图…
项目案例

本体域与业务的关联

评测对象是谁?

资产与站点域

对齐 AssetOpsBench 的 site、asset 和 asset profile 数据,表达 MAIN 等站点、Chiller、Pump、Compressor、Motor、Fan、AHU 等资产类别,以及资产层级、位置和部件关系。

证据从哪里来?

传感器与遥测域

连接 installed_sensors、measured_sensors、history、latest_reading、sensor_coverage 和 sensor_stats 等工具输出,说明传感器、测量字段、时序记录、覆盖率和质量报告之间的关系。

故障如何解释?

故障模式与可靠性域

围绕 FMSR 的 get_failure_modes、generate_failure_modes 和 failure code 数据,将资产类别、失效模式、失效症状、传感器关系和 FMEA 知识统一到可查询语义结构。

维护动作如何落地?

工单与维护域

覆盖 work order、任务、人工、成本、KPI、状态、优先级和预测性维护触发来源,支撑工单查询、生成、审批、分派、关闭和后续审计。

模型如何参与运维?

时序建模与振动诊断域

映射 TSFM 的模型卡、特征卡、recipe、run record、forecast / anomaly result,以及振动数据、FFT、包络谱、轴承频率和 ISO 10816 严重度诊断结果。

如何判断 Agent 做得对?

场景、轨迹与评测域

把 Scenario、GroundTruth、AgentRun、McpTool、EvaluationReport 和操作指标关联起来,使最终答案、调用顺序、证据来源、评分维度和聚合报告可以被复查。

项目案例

6 个应用场景

场景 1

资产台账与传感器查询

客户问题

运维人员需要确认某个站点有哪些资产、资产详情和已安装或实际产生数据的传感器,但这些信息通常分散在台账与遥测记录中。

本体做法

按照 AssetOpsBench 的 IoT MCP 工具链读取 sites、asset_ids、asset_detail、installed_sensors、measured_sensors、sensor_coverage 等证据,并用本体关联站点、资产、传感器和测量字段。

应用效果

平台能够评估 Agent 是否真实查询了台账和遥测证据,而不是凭资产名称直接生成答案。

输出内容
  • 资产与站点查询结果
  • 传感器安装和实测覆盖说明
  • 可复评的工具调用轨迹
场景 2

故障模式检索与补充

客户问题

面对 Pump、Chiller 等资产类别时,Agent 需要区分已有 failure modes、可生成补充项和数据库写入边界。

本体做法

使用 FMSR 的 get_failure_modes、generate_failure_modes、add_failure_modes 等工具区分读取、生成和持久化动作,本体将失效模式、资产类别、传感器和 FMEA 关系串联起来。

应用效果

评测能够检查 Agent 是否按任务要求获取已知故障模式,并在需要生成或写入时保留来源和操作边界。

输出内容
  • 资产类别故障模式清单
  • 生成建议与来源说明
  • 故障模式和传感器关系解释
场景 3

时序模型选择与异常检测

客户问题

时序预测或异常检测任务需要先理解数据质量、任务类型和模型卡约束,再执行 recipe 并保存结果,流程较长且容易漏步。

本体做法

通过 TSFM MCP 工具执行 list_tasks、profile_series、data_quality、find_models、resolve_model、recipe_template、run_recipe、evaluate、list_results 等步骤,并把模型卡、特征卡、运行记录和结果索引纳入本体。

应用效果

平台能够评估 Agent 是否基于数据和模型卡做选择,并保留预测、异常检测和复评分发所需的运行证据。

输出内容
  • 数据画像与质量结果
  • 候选模型与 recipe
  • forecast 或 anomaly result
  • TSFM run record
场景 4

振动诊断与设备健康判断

客户问题

旋转设备诊断不仅要读取振动数据,还要计算 FFT、包络谱、轴承特征频率和严重度分区,单纯文本推理很难保证依据完整。

本体做法

使用 Vibration MCP 工具获取振动序列、计算频谱和包络谱、识别轴承频率并形成诊断报告,本体记录振动分析、轴承频率、严重度评估和诊断结果。

应用效果

评测时可以看到 Agent 是否调用专门诊断工具,并把故障判断与可检查的信号处理结果对应起来。

输出内容
  • 振动数据引用
  • 频谱峰值和轴承频率计算
  • 严重度评估
  • 诊断报告
场景 5

工单分析与维护动作建议

客户问题

工单任务需要同时处理状态、优先级、成本、计划与实际差异、技师分派和故障代码,错误操作可能影响维护流程。

本体做法

基于 WO MCP 的 list_workorders、get_workorder、get_workorder_tasks、get_workorder_costs、get_workorder_kpis、generate_work_order、approve_workorder、assign_technician、close_workorder 等工具划分读取和写入动作,本体同步表达工单状态和触发来源。

应用效果

Agent 的维护建议不再只是文本结论,而是能追溯到工单字段、状态规则、触发来源和审批动作。

输出内容
  • 工单查询与 KPI 摘要
  • 成本和计划差异说明
  • 工单生成或更新记录
  • 维护动作依据
场景 6

场景套件批量基准测试

客户问题

团队需要比较 direct_llm、stirrup_agent、opencode_agent 等不同 Agent 或模型在多类工业任务上的表现,但手工运行无法保证一致性。

本体做法

使用 Scenario Suite Runner 通过 car、fcc、fmsr、health、tsfm、wosr 分类 selector 或 lite / all profile 批量运行,保存 trajectory 后用 static_json 或 LLM Judge 生成单场景和聚合报告。

应用效果

平台能够用同一套场景、ground truth 和评分口径比较不同 Agent,并支持在不重跑 Agent 的情况下重新评分。

输出内容
  • 按 Agent 和模型分组的 trajectory
  • 单场景评分 JSON
  • _aggregate 聚合报告
  • 按场景类型统计的通过情况和操作指标
业务示意

以 Chiller 6 异常检测工单为例

评测人员选择工单或健康类场景后,Runner 读取场景问题、manifest 和 groundtruth。Agent 先通过 IoT 工具确认 Chiller 6 的资产详情、传感器和可用遥测,再通过 TSFM 工具检查数据质量、选择模型卡、运行异常检测 recipe,并在需要形成维修闭环时调用 WO 工具生成或查询工单。整个过程中,轨迹记录会保存 Agent 的 run_id、scenario_id、工具调用和最终答案;Evaluator 再按 groundtruth 和六维 rubric 检查任务完成、数据检索准确、结果验证、步骤顺序、说明清晰以及是否存在幻觉。页面中的本体关系用于说明:资产、传感器、异常结果、工单、触发来源和评测报告之间为什么能被串起来,而不是把异常检测结论当作孤立文本。

项目案例

项目交付成果

基准测试框架

  • AssetOpsBench 场景套件组织方式
  • Agent 运行入口与 selector 使用口径
  • 按 Agent / 模型分组的轨迹和报告目录结构

领域 MCP 工具体系

  • IoT 资产台账与遥测工具
  • FMSR 故障模式工具
  • WO 工单工具
  • TSFM 时序模型与特征工具
  • Vibration 振动诊断工具

工业资产运营本体

  • 站点、资产、传感器、遥测、故障、工单、告警、模型、振动和评测模块
  • OWL 公理、属性链、枚举类和 SWRL 规则
  • 与 CouchDB 集合、MCP 工具和场景 ID 的映射说明

评测与观测结果

  • trajectory JSON
  • 单场景 ScenarioResult
  • _aggregate 聚合报告
  • 通过率、分类结果、工具调用、token、耗时和成本等操作指标

公开案例展示内容

  • 客户问题和使用前后对比
  • 能力域与实施场景说明
  • 评测闭环图、本体关系图和运行时序图
  • 可继续跳转的关联本体资产
项目案例

业务价值

看得懂

把工业 Agent 评测拆成资产、传感器、故障、工单、模型和评分对象,让非算法角色也能理解评测在测什么。

找得到

从场景 ID、run_id、工具调用和报告索引追溯证据来源,定位 Agent 答案依赖了哪些运维数据。

质量更清

将监测数据、诊断依据、模型输出、处置记录和复盘结论统一留痕,目标关键告警归因覆盖率达到 95% 以上,诊断证据完整率达到 98% 以上,异常定位时间压缩到 15 分钟内,复盘闭环率提升至 95% 以上。

做得动

通过 MCP 工具把资产查询、故障模式、时序 recipe、振动诊断和工单处理转化为可执行步骤。

可持续

场景、轨迹和评分器解耦,同一批轨迹可以换 scorer 或 judge model 重新评价,支持后续模型与 Agent 迭代。

在线案例

物联网行业:工业资产运维智能体基准评测

登录后查看完整案例

案例信息可公开浏览,在线案例仅向已登录客户开放。

案例留言

围绕这个案例继续交流

公开展示审核通过的会员留言,帮助案例经验持续完善。

0 条公开留言
登录后参与留言案例留言仅面向已登录会员
0/1000
暂无公开留言

成为第一个围绕这个案例提出问题或分享复现经验的会员。