炎龙智能 Agentic AIOps炎龙智能 Agentic AIOps
首页
平台介绍
功能总览
能力补充
监控与运维
首页
平台介绍
功能总览
能力补充
监控与运维
  • 平台指南

    • 平台介绍
    • 功能总览
    • 能力补充
    • 快速了解
    • 部署与支持

功能总览

本文档按模块说明炎龙智能 Agentic AIOps 已实现的产品能力:每项只描述「能解决什么问题」,不涉及内部实现。


1. 平台与租户

多租户管理

  • 一套平台服务多个客户,租户之间数据与配置隔离。
  • 创建租户时自动生成管理员账号,并复制菜单、角色、场景模板、大模型配置、智能体绑定等,新客户可快速上线。
  • 支持租户有效期控制,过期后禁止登录并提示联系管理员。

用户与权限

  • 基于角色的菜单与按钮权限,控制谁能看到哪些页面、执行哪些操作。
  • 支持部门、岗位、字典、参数、操作日志等基础治理能力。
  • 支持企业统一认证登录,满足 SSO 与集中账号管理需求。

首页仪表盘

  • 登录后展示关键运维指标与模块入口,快速了解当前环境概况。
  • 支持按权限展示不同模块,便于不同角色聚焦各自工作。

授权与交付

  • 支持离线私有化 License 交付与加密安全交付(面向商业部署场景)。

2. AI 智能助手

对话式运维(AI 天穹)

  • 用自然语言查询和操作已纳管的资源,例如查看主机负载、查数据库、看 K8s Pod、检索链路等。
  • 支持流式输出,实时看到 AI 思考与回复过程;对话过长时可自动压缩历史。
  • 支持对话快捷键,常用问题一键发起;支持主动中断进行中的分析任务。
  • 各业务模块可一键跳转到 AI 助手,并自动带上当前实例上下文,无需重复描述环境。
  • 支持 Web、飞书机器人等多通道入口(飞书支持作用域选择与危险操作审批卡片)。

Deep / Quick 双模式

模式行为适用场景
Deep(思考校验)自动规划、调用工具、多轮分析;高危操作走审批复杂排障、跨组件根因
Quick(快速模式)只生成命令,您确认「运行」后才执行低风险查询、强人机确认

三种协作模式

模式适用场景
单实例针对一台 Redis、一个数据库实例等单独操作
业务组多个组件编为一组,由协调智能体统一调度,适合联合排障或联合巡检
根因追问在告警分析完成后,继续就同一故障上下文追问细节

业务组编排

  • 将多台主机、多个中间件实例组织为「业务组」,定义谁参与协同。
  • 可标记业务组是否纳入告警根因分析的分组范围。
  • 适合「一次故障涉及多个系统」或「一次巡检覆盖整条业务链」的场景。

工具扩展市场(MCP)

  • 浏览、安装、测试外部工具扩展(MCP),扩展 AI 可调用的能力。
  • 支持内置与远程来源;可做连通性测试。
  • 内置常用运维能力已预置,开箱即可对接主机、数据库、K8s、Prometheus 等。
  • 智能体与工具扩展的绑定关系统一管理,便于复用与变更。

知识库

  • 智能体级知识库:绑定手册/SOP/排障指南,每次提问自动检索。
  • 对话级知识库:单次会话临时上传文档,仅当前对话有效。
  • 两层检索合并使用,形成更贴合企业规范的专属回答。

工作流 / Chatflow

  • Workflow:可视化节点任务流,可发布为 API,或作为工具被其他流程/智能体复用。
  • Chatflow:对话流应用,适合会话式输入输出。
  • 统一使用平台 Token 鉴权;可在 AI 天穹中选择已发布工作流协同执行。

大模型配置

  • 支持配置多个大模型实例(云端 API / 私有化推理),按场景选择模型与参数(温度、上下文长度等)。
  • 支持模型与智能体热更新,与租户模板复制联动,开箱可用。

3. 智能根因分析(RCA)

解决的问题

  • 告警风暴时不知道哪几条相关、该先处理谁。
  • 人工排查跨多个组件,耗时长且依赖个人经验。
  • 分析结论难以沉淀,同样问题反复踩坑。

平台能做什么

  • 接收外部监控系统(Prometheus / Zabbix / 其他 Webhook)推送的告警并入库,支持字段映射与 API Key 鉴权。
  • 按业务组或默认规则将相关告警在时间窗口内归组;支持按告警语义相似度聚合重复/同源告警。
  • 自动调度多个专业智能体并行分析,输出根因报告与处理建议;可从报告中结构化提取故障簇。
  • 告警状态清晰展示:待分析、AI 分析中、AI 已给出方案;支持告警静默与严重级别升级通知。
  • 分析完成后可在同一上下文继续 AI 追问,无需重新描述背景。
  • 分析开始与完成时,可按规则向指定人员发送通知(短信、邮件、飞书、钉钉、企业微信)。
  • 可作为企业运维主平台的智能增强层,分析结论回传主平台落库(增量集成场景)。

安全约束

  • 根因分析场景下,AI 不会执行删除文件、变更权限等破坏性操作,以分析建议为主。

4. AI 智能巡检

解决的问题

  • 人工巡检项多、易遗漏、难以标准化。
  • 巡检结果分散在聊天记录或临时文档,不便追溯。
  • 发现问题后还要再开一轮排查,上下文断裂。

平台能做什么

  • 配置巡检任务:选择业务组或 实例类型 + 实例(含 K8s 集群),设置执行周期(支持自然语言辅助生成 Cron 表达式)。
  • 定时自动执行,对 Linux、数据库、K8s 等资源做只读健康检查。
  • 生成结构化巡检报告并落库,巡检日志可直接查看历史记录。
  • 巡检成功或失败后,可跳转 AI 天穹 继续追问,例如「这条异常怎么修」。
  • 巡检失败或发现异常时,可按规则通过飞书等渠道发送通知。

操作步骤见 AI 智能巡检操作指南;飞书通知见 飞书接收 AI 巡检告警。


5. 告警与通知

告警记录

  • 集中查看告警通知与根因分析相关记录。
  • 支持按标题搜索、按处理时间排序、查看分析组详情。
  • 展示 AI 分析进度与最终结论。

通知配置

  • 按人员、告警模块(根因分析 / AI 巡检等)、通知渠道配置规则。
  • 已支持:短信、邮件、飞书、钉钉、企业微信。
  • 通知对象使用系统用户已维护的手机号、邮箱及各 IM 账号。
  • 飞书通知前可在用户管理中 批量获取飞书用户 ID。

6. 主机与基础设施

主机管理

  • 纳管 Linux / Windows 服务器及网络设备,维护 SSH 等连接信息。
  • 支持手动录入、Excel 批量导入、内网自动发现后选择性入库。
  • 信息完善度提示,快速找出尚未配置完整的主机。
  • SSH 连通性测试;可查看 CPU、内存、磁盘等基础监控数据。
  • 主机可绑定智能体,供 AI 远程执行只读命令或经审批的特权命令。

主机与基础设施类型(细分)

除通用主机外,还可按场景纳管(按交付版本启用):Nginx 主机、宝蓝德 Java 应用服务器、Ansible 主机、路由器/交换机/防火墙/负载均衡、NAS、ESXi、堡垒机、IPMI 带外、数据库主机(OS 侧)等。

网络设备

  • 支持华为等厂商网络设备的命令级运维能力(视实例与智能体配置而定)。

机柜与虚拟化

  • 以机柜维度组织服务器;支持机房 IDC / 刀片等资产模型(视菜单权限开放)。
  • 支持 vCenter / VM 等虚拟化纳管与监控(按交付启用)。

7. 数据库与数据服务

数据库实例管理

  • 统一管理 MySQL 等关系型数据库连接信息。
  • 支持连接测试、实例与智能体绑定。
  • 提供 MySQL 专项视图:变量、表、慢查询、进程、集群等(视实例类型开放)。

AI 可操作的数据库能力

  • 只读查询:日常查数、看结构、排查问题。
  • 特权变更:DDL/DML 等变更需走审批流程,变更前后可对比差异,降低误改风险。

NoSQL

  • 支持 MongoDB 等 NoSQL 实例纳管与 AI 辅助运维。

Text2SQL

  • 用自然语言生成并执行查询,降低非 SQL 人员的取数门槛(视模块开放)。
  • 支持库表结构感知问答;表结构变更后可同步更新知识(按实例配置启停)。

8. 中间件与可观测性

平台支持纳管并通过 AI 或监控视图操作的中间件与系统包括(视您购买的模块与实例配置而定):

类别典型组件
缓存Redis、Memcached
消息队列Kafka、RabbitMQ、RocketMQ、ActiveMQ
搜索 / 日志Elasticsearch、Loki、OpenSearch(按交付启用)
注册配置Nacos、ZooKeeper
监控Prometheus、Zabbix、Grafana
链路追踪SkyWalking(链路 / 拓扑 / Profile)
容器Kubernetes
CI/CDJenkins、GitLab
IoTEMQX(MQTT)
数据库扩展PostgreSQL、Oracle、SQL Server、达梦、金仓、OceanBase、openGauss 等(按交付启用)

各模块通常提供:实例管理、连接测试、基础指标或状态查看、一键跳转 AI 助手等能力。


9. 技能包(Skills)

面向标准化场景,平台提供可复用的技能包,由 AI 按规范执行,输出报告或处理建议:

技能能帮您做什么
Linux 服务器巡检负载、CPU、内存、磁盘、systemd、TOP 进程、Docker 状态等只读健康检查
MySQL 巡检数据库侧健康与性能项检查
K8s 负载检测与处理节点与 Pod 负载分析,辅助定位高负载资源
网络设备巡检华为、H3C、Cisco 等厂商设备的巡检能力
等保测评辅助资产梳理、基线检查、漏洞扫描、报告生成等合规相关工作

技能包强调场景化交付:说清要什么检查,AI 按技能规范执行并给出 Markdown / HTML 报告。导入格式与 SKILL.md / zip 约定见 技能包规范。


10. 安全与审批

特权命令

  • 重启、关机、创建用户等 Linux 高危命令必须经审批后执行。
  • 平台提供特权命令任务列表与审批界面,全程留痕。

特权数据库操作

  • 只读 SQL 可直接查询;涉及表结构变更、数据变更等需审批。
  • 审批前后可展示变更差异(ShowDiff),便于审核人判断。

安全防护开关

  • 可按租户或环境策略配置:命令验证、特权阻断、限流、审计日志、安全防护总控等。

自愈边界

  • 已具备自愈预案匹配与受控执行能力;生产默认人机协同,全自动无人值守自愈不默认开放。

11. 风险预测、拓扑与对接

  • 15 天资源趋势预测:对磁盘、CPU、内存、IO、网络等做未来趋势预测,生成可跟踪风险单,支撑事前扩容/清理。
  • 曲线形态降噪:识别尖峰、毛刺、缓增缓降、陡升及周期规律波动,区分真异常与正常业务潮汐。
  • 架构拓扑图:按层级/状态过滤,节点详情与一键 AI 分析(视模块开放)。
  • Token / Webhook:平台 API Key 供工作流与外部系统调用;Webhook 接入第三方告警/事件。
  • DevOps 联合排障:GitLab / Jenkins、部署任务与模板、代码质量分析(按客户打开菜单)。
  • 定时任务管理:平台级调度,与巡检任务联动。
  • 等保取向审计:操作留痕、敏感脱敏、取证导出(视合规交付范围)。

更完整的增补说明见 能力补充。


典型使用路径

  1. 管理员:创建租户 → 配置用户权限 → 纳管主机与各类实例 → 编排业务组与智能体 → 配置告警通知。
  2. 值班运维:看首页与告警列表 → 查看 AI 根因报告 → 必要时跳转 AI 追问 → 审批特权变更。
  3. 巡检人员:配置/手动触发 AI 巡检 → 阅读报告 → 对异常项继续 AI 诊断。
  4. 业务负责人:查看巡检与告警统计,了解系统健康趋势(视报表权限开放)。

如需了解某一模块的详细能力边界,请继续阅读 监控与运维 分册;进阶与增补能力见 能力补充。

最近更新:: 2026/8/24 08:54
Contributors: sunxiaokun, yanlong-ai, Cursor, yanlongai
Prev
平台介绍
Next
能力补充
© 2026 炎龙智能科技 · 保留所有权利