项目演示
以下内容选自实际项目,呈现从模型训练、Agent 工具调用到工程流程与工业现场的完整链路。仅对包含账号、联系方式或业务敏感信息的画面进行脱敏;部分素材来自作者公开发布的 B 站视频,网页版本已做剪裁与静音处理。
EvoAI 视觉模型工作流
以实例分割项目展示数据集、标签体系、标注工作台与训练模型的一体化流程。
企业知识 Agent
从数据分析到文档产出,展示 Agent 如何通过连续工具调用完成一项完整任务。
数据分析 Agent
读取多份表格与分析要求,连续调用工具生成分析脚本、图表和综合报告。
文档识别与结构化录入
识别打印、手写和繁体文档,将关键信息转换为可编辑的结构化字段。
三维装配 Copilot
通过自然语言定位装配体中的零部件,并把查询转化为可见的三维操作。
高速视觉分选
工业视觉模型在高速产线上的实时识别与分选。
视觉隐私脱敏
自动识别视频中的行人与车牌,并生成可直接交付的隐私保护版本。
WebSeg 交互式标注工具
面向目标检测与分割任务的轻量 Web 标注工作台,并以开源项目持续维护。
机器人 Web 控制与实时回传
通过平板端 Web 界面控制机器狗运动,并同步查看相机画面与设备状态。
企业级 Agent 平台
把分散的模型、知识和工具接入一个受治理的 Agent 运行时,让团队能够用它完成真实工作。
- 12个系统接入
- 10个复用 Skills
- 99.93%平台可用性
- 挑战
- 企业里的 AI 试点往往各自使用不同的知识、工具和控制方式。挑战是将它们整合为共享平台,让 Agent 能理解任务、调用企业能力、完成工作,并通过评测持续改进。
- 角色
- 平台和研发负责人,管理由前端、后端、算法、数据、测试与运维组成的 50+ 人跨职能团队。
- 关键决策
- 将模型、知识、数据、工具、Skills、权限、审计、评测和运营纳入同一运行时,而不是把它们当作彼此独立的功能。
- 系统
- 任务规划、MCP 与连接器、Skill 生命周期、沙箱执行、引用追溯、人工确认、风险控制、回归评测与可观测性。
- 结果
- 接入 12 个内部系统,交付 10 个可复用 Skills。验收数据包括普通问答平均 2.3 秒、20 并发稳定运行 72 小时、99.93% 可用性和 95% 检索准确率。
工业多模态与工程 Agent
让图纸、三维模型、BOM 与工艺知识进入同一条可复核的工程工作流。
- 图纸二维信息理解
- STEP三维特征证据
- 工艺与报价可检查的输出
- 挑战
- 工程任务同时涉及图纸、三维模型、BOM、工艺知识、成本和专业工具。系统不仅要理解这些对象,还要沿着真实流程产出可使用的结果。
- 角色
- 连接多模态模型、工程流程与交付约束的产品、平台和研发负责人。
- 关键决策
- 将 CAD/STEP 证据、BOM 关系、加工特征、相似检索、可加工性和报价拆成可检查的中间结果,使最终建议能够被工程人员复核。
- 系统
- 图纸与三维理解、相似件检索、工艺生成、自动报价、人工审核与反馈沉淀。
- 结果
- 形成可复用的工程 Agent 路径:理解零件、检索相似任务、提出工艺并生成报价建议,每一步都保留可检查的依据。
模型与数据闭环
把数据、训练、评测、部署和线上反馈连成可追溯、可复现的模型生命周期。
- 120+个数据集
- 200 万+标注图像
- 99.5%识别准确率
- 挑战
- 在持续提升多模态识别效果的同时,确保每一次数据、训练、评测和部署过程都可以复现。
- 角色
- 负责模型体系、云端推理、标注训练平台和工程交付的软件算法负责人。
- 关键决策
- 围绕数据版本、标注、实验、评测基线、部署产物和线上反馈建立生命周期。
- 系统
- 120+ 数据集、200 万+ 标注图像、100+ 模型产出,以及从采集到生产反馈的连续链路。
- 结果
- 识别准确率从 92% 提升至 99.5%,推理速度提升 50%。
EvoAI 视觉模型工作台
用一套可私有化部署的工作台,承接数据导入、标注、训练、测试和推理交付。
- 4 类任务分类、检测、分割、异常
- ONNX标准模型交付
- 私有部署数据与运行边界
- 挑战
- 工业视觉项目依赖分散脚本和人工传递,数据、训练与交付彼此割裂。需要用同一套系统承接原始数据,并产出可训练、可测试、可交付的模型。
- 角色
- 负责从产品工作流、系统架构到训练运行时和交付边界的整体设计与实现。
- 关键决策
- 以项目和当前数据集为主线,统一数据状态、标注、训练任务、模型产物和测试反馈。大文件导入和训练做成可恢复的异步任务。
- 系统
- 覆盖分类、检测、分割与异常检测,包含数据导入、图像标注、训练任务、模型注册、单图测试、结果回流,以及 ONNX 与 Windows 推理交付。
- 结果
- 形成可私有化部署的视觉工作台,使数据、训练、模型和部署产物始终处于同一条可追溯链路中。
强化学习、机器人与实时 AI
从分布式策略训练、机器人 Web 控制到大规模视觉检测,处理实时环境中的感知、决策与回传。
- 1500+CPU 核训练
- 300台设备并发
- 99%异常检测准确率
- 挑战
- 复杂在线环境既需要训练决策策略,也需要连接机器人控制、视觉感知和设备状态;各环节共享实时系统基础,同时保持清晰的安全边界。
- 角色
- 负责环境、分布式学习、视觉感知、评测与生产部署的算法研究员。
- 关键决策
- 将环境保真、策略学习、UI 感知和线上评测分开设计;异常检测则围绕可量化的运维验收构建,而不是只关注单次准确率。
- 系统
- 使用 1500+ CPU 核的分布式强化学习平台,构建 AGV 与机器狗的 Web 控制、实时轨迹和相机回传原型,并交付支持 300 台设备并发的视觉异常检测服务。
- 结果
- UI 驱动的游戏 Agent 达到钻石 9;完成机器人远程控制与状态回传验证;视觉异常检测准确率 99%,检测时间缩短至 30 分钟。
长期个人 AI 与多角色协同平台
让上下文跨时间延续,让工具在权限内读写真实记录,并为关键判断保留人的确认。
- 时态记忆事实版本与遗忘
- 角色隔离身份与数据边界
- 人工确认关键动作可控
- 挑战
- 个人 AI 需要理解随时间变化的事实、偏好、目标和真实行为,同时严格守住不同身份、角色与数据之间的边界。
- 角色
- 负责 Agent 运行时、领域模型、数据与记忆架构、AI 工具链和生产交付体系的整体设计与持续演进。
- 关键决策
- 将聊天历史、当前事实、业务记录、知识证据和临时执行状态分开建模;长期记忆按身份与对象隔离,事实变化通过版本更新表达,遗忘过程可审计,重要判断保留人工确认。
- 系统
- 流式 Agent、结构化工具调用、时态长期记忆、向量召回、知识检索、多模态输入、长期记录、多角色权限、审计、幂等与安全策略。
- 结果
- 对话能够跨时间延续,工具能够在权限内读写真实记录,同时让 AI 建议、确定性规则和人的决策保持清晰边界。
- 身份隔离
- 证据可追溯
- AI 与规则分离
- 关键环节人工确认
围绕 AI 团队建设、Agent 平台规划与生产落地等问题,可通过 xujiayu0606@gmail.com 联系。