# 窗口视觉 AI 客服智能体 **Repository Path**: oywb33/Window-AI-Customer-Service-Agent ## Basic Information - **Project Name**: 窗口视觉 AI 客服智能体 - **Description**: 「窗口视觉 AI 客服智能体」落地实施方案 - **Primary Language**: Unknown - **License**: Not specified - **Default Branch**: master - **Homepage**: None - **GVP Project**: No ## Statistics - **Stars**: 0 - **Forks**: 0 - **Created**: 2026-09-18 - **Last Updated**: 2026-09-18 ## Categories & Tags **Categories**: Uncategorized **Tags**: None ## README # 窗口视觉 AI 客服智能体 #### 介绍 「窗口视觉 AI 客服智能体」落地实施方案 # AI同款「窗口视觉AI客服智能体」落地实施方案 > 定位:**MVP优先,只做【聊天窗口自动回复】,不做通用复杂电脑操作;客户端本地截图+键鼠模拟,云端VLM+LLM+RAG,无需IM平台API;适配微信/抖音/千牛/闲鱼桌面端**。 > 目标:圈选聊天窗口 → 持续监听窗口 → 识别新消息 → 知识库检索 → AI生成回复 → 自动填入输入框发送;支持「人工预审模式」(草稿先弹窗,人工确认再发送,降低风控) ## 一、总体架构(4大模块,解耦设计) **架构模式:本地客户端(感知+执行) + 云端服务(推理+知识库+管理后台)** ``` 【Windows桌面客户端】 ├─窗口捕获模块(只捕获圈选窗口,非全屏) ├─图像预处理 + 窗口状态对比(判断是否新增消息) └─键鼠执行模块(模拟点击、中文输入、剪贴板) ↓HTTP/WebSocket 【云端服务端】 ├─VLM视觉识别服务(截图→OCR+UI元素定位,识别新消息、输入框坐标) ├─Agent任务规划器(判断是否回复、区分会话、防重复回复) ├─RAG知识库(产品FAQ、话术、禁词、人设) ├─LLM生成回复 + 安全校验(敏感词过滤) └─管理后台:账号管理、会话日志、知识库上传、配置中心、统计报表 ``` ### 核心闭环循环(每1.5~3秒轮询一次,可配置) 1. 客户端捕获**指定窗口**截图,做差分对比,判断画面是否更新 2. 截图上传云端VLM:识别聊天记录、判断是否有**未读新消息**,输出结构化对话文本+UI坐标(输入框、发送按钮像素位置) 3. Agent判断:是否需要回复、当前会话上下文、客户意图;RAG检索业务资料 4. LLM生成回复,经过**敏感词/禁止话术校验** 5. 返回指令给客户端:坐标+待发送文本 + 模式标记(自动发送 / 人工预审) 6. 客户端执行:定位输入框、粘贴文字、点击发送;记录执行日志 7. 进入下一轮循环 > 重要:**不读取软件内存、不HOOK进程,完全基于截图+系统原生键鼠事件**,和识流原理一致。 ## 二、模块详细技术选型 & 职责 ### 1. Windows桌面客户端(优先C# WPF / Python打包exe;MVP推荐Python快速验证) |模块|技术选型|说明| |---|---|---| |窗口捕获|Windows Graphics Capture / mss库|只捕获用户圈选的窗口句柄,支持高DPI缩放,排除无关窗口;不录屏,只定时静态截图| |画面差分检测|OpenCV|对比上一轮截图,画面无变化直接跳过,减少VLM调用,降低成本| |键鼠执行|SendInput API(优先);pyautogui备选|**禁止直接pyautogui.typewrite输入中文**,使用剪贴板粘贴;SendInput更接近真人操作,风控略友好;获取输入框、发送按钮坐标,执行点击| |本地配置&日志|SQLite|保存窗口句柄、轮询间隔、人工预审开关;本地缓存会话快照,网络断连不崩溃| |通信|WebSocket|长连接推送截图,实时接收云端动作指令;日志异步上报| > 风控优化:增加随机延迟(500~1500ms),模拟人打字间隔,固定间隔容易被平台检测自动化。 ### 2. 云端服务(PHP/Java后端,你现有ThinkPHP/Java体系可复用) #### 2.1 VLM视觉模块(二选一) 方案A(最简MVP,直接调用API):Qwen-VL / GPT4o / 通义千问视觉API > Prompt固定:`识别截图聊天窗口,提取全部对话,区分历史消息和最新未读消息;输出输入框、发送按钮像素坐标;不要额外描述,输出JSON结构化结果` 方案B(后期私有化):本地部署Qwen2-VL,减少API费用 #### 2.2 Agent规划器(LangGraph最简实现) 职责: - 会话记忆:维护对话上下文,区分不同买家会话 - 防重复回复:记录已回复消息ID,避免一轮消息重复应答 - 状态判断:识别「客户正在输入」,暂停回复 - 分支判断:简单咨询直接自动回复;高风险/复杂问题 → 进入人工预审模式 #### 2.3 RAG知识库模块(复用你现有后端) - 文档解析:PDF/Word/TXT,切片、向量化 - 向量库:Chroma / Milvus(企业级) - 检索召回:根据客户问题匹配FAQ、产品话术、价格、售后规则 - 支持:人设配置、禁止词、拒绝回答模板 #### 2.4 安全校验模块 - 敏感词库拦截 - 金额、手机号、微信等风险内容识别 - 可配置黑白名单 #### 2.5 管理后台 功能清单: 1. 客户端设备管理:多电脑、多会话在线状态 2. 知识库管理:文档上传、在线编辑FAQ 3. 会话日志:所有对话记录、AI草稿、发送记录 4. 全局配置:轮询间隔、自动/人工预审开关、模型选择、prompt管理 5. 统计:消息量、回复率、人工介入率 ## 三、分阶段实施计划(3阶段,MVP优先,快速验证) ### 阶段1:MVP原型验证(3~4周,最小可用,只验证核心闭环) **范围:仅Windows客户端,单窗口,单聊天软件(优先微信PC),人工预审模式** 1. 客户端开发:窗口圈选、截图、画面差分、键鼠粘贴输入 2. 云端:VLM API调用 + LLM对话生成 + 简易RAG(FAQ) 3. Agent最小逻辑:识别新消息、上下文记忆、防重复回复 4. 只启用**人工预审模式**:AI生成草稿,弹窗人工确认后才发送(规避账号封号风险) 5. 测试:单电脑跑1个微信会话,验证识别准确率、坐标定位、中文输入 > 阶段1目标:跑通完整闭环,验证VLM识别消息准确率;**不开放全自动发送** **阶段1交付物** - Windows客户端exe - 后端API服务 - 简易后台:知识库上传、会话日志 - 测试脚本 ### 阶段2:产品化迭代(4~6周) 1. 增加全自动模式开关(用户手动开启,风险提示) 2. 优化UI坐标定位,修复高DPI、窗口缩放错位问题 3. RAG增强:支持多文档、权重配置、多套话术人设 4. 风控策略优化:随机延迟、消息频率限制、连续提问阈值 5. 多软件适配:抖音PC、千牛、闲鱼 6. 告警:识别界面异常、客户端掉线、VLM识别失败 ### 阶段3:企业版(2~3个月,规模化部署) 1. 私有化VLM部署,降低API调用成本 2. 多设备集中管理、权限体系、子账号 3. 人工坐席接管:AI会话一键转入人工客服 4. 操作审计日志、数据导出 5. 性能优化:批量会话、缓存策略,降低token消耗 ## 四、人力与成本评估(MVP阶段) > MVP(阶段1)人力配置 - 后端:1人(复用你现有PHP/Java,RAG、API网关、管理后台) - 客户端开发:1人(C# / Python打包exe) - AI提示词/测试:1人(调VLM Prompt、知识库、测试会话) > 算力/API成本:按量付费,小规模测试每月几百~一两千;规模化后可切换本地VLM降低费用 ## 五、风险清单 & 应对方案(最重要,GUI Agent最大坑) ### 风险1:平台风控,账号封号(最高优先级) 对策: 1. MVP默认**强制人工预审**,全自动模式需要用户手动勾选+风险提示 2. 增加消息频率限制,禁止短时间大量发送 3. 模拟真人行为:随机打字间隔、随机鼠标移动,不要固定坐标点击 4. 不批量多账号同时跑,单台电脑建议1~2个账号上限 ### 风险2:UI界面改版,VLM识别失效 对策: 1. Prompt增加容错;增加置信度判断,识别置信度过低直接跳过,标记人工处理 2. 优先稳定版本客户端,软件自动更新后暂停自动回复 ### 风险3:坐标定位偏差,点错按钮 对策: 1. VLM同时返回输入框的边界框,增加校验;找不到输入框直接不执行操作 2. 高DPI自动适配,客户端做像素坐标换算 ### 风险4:重复回复、漏消息 对策: 1. 每次识别消息生成消息指纹,存入内存+数据库,已处理消息不再回复 2. 画面差分+VLM双重判断新消息,避免误判 ### 风险5:隐私合规 对策: 1. 仅捕获用户圈选窗口;**默认不上传截图永久存储**,可配置临时缓存用于调试;客户可关闭截图上传,只上传VLM提取的文本。 2. 明确告知客户:本产品会捕获窗口画面,用于AI识别对话。 ## 六、与你现有租赁业务系统集成方案(重点,贴合你当前项目) > 你现有:支付宝租赁V3订单系统,ThinkPHP后端 1. 管理后台直接复用现有后端,新增知识库、会话日志表;不用独立搭建一套后台 2. 会话中识别客户咨询【租金、订单、履约】,调用你已写好的 `AlipayRentService` 接口,查询租赁订单、同步租金支付状态 3. 当客户询问订单号、租金、期数,RAG检索业务数据,调用你的订单接口,把订单信息嵌入AI回复 > 举例:客户问「我的租金还有几期?」→ VLM识别问题 → Agent调用你本地租赁订单接口拿到数据 → LLM生成带订单信息的回复 ## 七、项目里程碑&验收标准 |阶段|时间|验收指标| |---|---|---| |MVP原型|3~4周|圈选微信窗口,识别新消息,AI生成草稿,人工确认后自动输入发送;无重复回复;坐标定位误差<10像素| |产品化|4~6周|支持多软件;全自动开关;知识库FAQ检索;会话日志完整| |企业规模化|2~3月|支持多电脑集中管理,人工接管,私有化VLM可选| ## 八、可选简化方案(如果不想自研客户端) 直接使用开源UI-TARS / ShowUI作为客户端底座,在此基础上二次开发,节省底层截图+键鼠开发工作量,聚焦业务Agent和RAG层。 ---