基于视觉理解 + 文字识别的 Windows 桌面自动化方案。核心组件:
- DAM-3B (NVIDIA 开源视觉模型) — 看一眼截图就知道界面状态
- EasyOCR — 读取 UI 上的中英文文字
- pyautogui — 控制鼠标键盘
附带微信自动回复 Bot — DB 读消息 + 独立窗口按键发送,搞定 CEF 渲染无控件应用。
┌────────────────┐
│ DAM-3B (GPU) │ ← 视觉理解:"这是聊天列表页"
└───────┬────────┘
│ screenshot
┌─────────┐ screenshot ┌─────▼──────────┐ click/type ┌──────────┐
│ 桌面 │ ────────────→ │ dam_server.py │ ────────────→ │ pyautogui│
│ (Win11) │ ←──────────── │ (HTTP :5099) │ ←──────────── │ (键鼠) │
└─────────┘ 分析结果 └────────────────┘ 屏幕坐标 └──────────┘
│ OCR
┌───────▼────────┐
│ EasyOCR (CPU) │ ← 读取文字: "文件传输助手"
└────────────────┘
| 文件 | 功能 |
|---|---|
dam_server.py |
DAM-3B 视觉服务(常驻内存 HTTP,5099 端口) |
wechat_recognizer.py |
微信 UI 识别器(DAM + EasyOCR 混合) |
auto_reply_oneshot.py |
微信自动回复 Bot(DB 读消息 + 独立窗口发送) |
先看再做再看 — 绝对禁止盲打盲点。
眼睛(DAM+EasyOCR)→ 手(键鼠)→ 眼睛(验证)
# 安装依赖 pip install -r requirements.txt # 启动视觉服务 python dam_server.py # 测试识别 curl -X POST http://localhost:5099/analyze -F "image=@screenshot.png"
- 确保 DAM-3B 模型文件在
models/目录下 - 启动视觉服务:
python dam_server.py - 启动 Bot:
python auto_reply_oneshot.py
⚠️ 遵循 AGENTS.md 的隐私原则 — 联系人信息、数据库密钥配置不在仓库内。
MIT