从研究到交付

AI 系统与项目案例

涵盖企业级 Agent 平台、数据分析 Agent、文档智能、工业视觉、模型与评测闭环、机器人控制和生产级 AI 交付的代表项目。

项目演示

以下内容选自实际项目,呈现从模型训练、Agent 工具调用到工程流程与工业现场的完整链路。仅对包含账号、联系方式或业务敏感信息的画面进行脱敏;部分素材来自作者公开发布的 B 站视频,网页版本已做剪裁与静音处理。

EvoAI 视觉模型工作流

以实例分割项目展示数据集、标签体系、标注工作台与训练模型的一体化流程。

  • 数据集
  • 标注
  • 训练
  • 模型交付

企业知识 Agent

从数据分析到文档产出,展示 Agent 如何通过连续工具调用完成一项完整任务。

  • 工具调用
  • 数据分析
  • 文档生成

数据分析 Agent

读取多份表格与分析要求,连续调用工具生成分析脚本、图表和综合报告。

  • 多文件分析
  • 工具调用
  • 报告生成

文档识别与结构化录入

识别打印、手写和繁体文档,将关键信息转换为可编辑的结构化字段。

  • 文档理解
  • OCR
  • 结构化抽取

三维装配 Copilot

通过自然语言定位装配体中的零部件,并把查询转化为可见的三维操作。

  • BOM
  • 三维装配
  • 工具交互

高速视觉分选

工业视觉模型在高速产线上的实时识别与分选。

  • 计算机视觉
  • 实时推理
  • 工业现场

视觉隐私脱敏

自动识别视频中的行人与车牌,并生成可直接交付的隐私保护版本。

  • 检测与跟踪
  • 视频处理
  • 隐私保护

WebSeg 交互式标注工具

面向目标检测与分割任务的轻量 Web 标注工作台,并以开源项目持续维护。

  • 开源工具
  • 目标分割
  • 数据标注

机器人 Web 控制与实时回传

通过平板端 Web 界面控制机器狗运动,并同步查看相机画面与设备状态。

  • 机器人
  • Web 控制
  • 实时系统

Agent 系统 · 平台与研发

企业级 Agent 平台

把分散的模型、知识和工具接入一个受治理的 Agent 运行时,让团队能够用它完成真实工作。

  • 12个系统接入
  • 10个复用 Skills
  • 99.93%平台可用性
挑战
企业里的 AI 试点往往各自使用不同的知识、工具和控制方式。挑战是将它们整合为共享平台,让 Agent 能理解任务、调用企业能力、完成工作,并通过评测持续改进。
角色
平台和研发负责人,管理由前端、后端、算法、数据、测试与运维组成的 50+ 人跨职能团队。
关键决策
将模型、知识、数据、工具、Skills、权限、审计、评测和运营纳入同一运行时,而不是把它们当作彼此独立的功能。
系统
任务规划、MCP 与连接器、Skill 生命周期、沙箱执行、引用追溯、人工确认、风险控制、回归评测与可观测性。
结果
接入 12 个内部系统,交付 10 个可复用 Skills。验收数据包括普通问答平均 2.3 秒、20 并发稳定运行 72 小时、99.93% 可用性和 95% 检索准确率。

工业多模态 · 工程 Agent

工业多模态与工程 Agent

让图纸、三维模型、BOM 与工艺知识进入同一条可复核的工程工作流。

  • 图纸二维信息理解
  • STEP三维特征证据
  • 工艺与报价可检查的输出
挑战
工程任务同时涉及图纸、三维模型、BOM、工艺知识、成本和专业工具。系统不仅要理解这些对象,还要沿着真实流程产出可使用的结果。
角色
连接多模态模型、工程流程与交付约束的产品、平台和研发负责人。
关键决策
将 CAD/STEP 证据、BOM 关系、加工特征、相似检索、可加工性和报价拆成可检查的中间结果,使最终建议能够被工程人员复核。
系统
图纸与三维理解、相似件检索、工艺生成、自动报价、人工审核与反馈沉淀。
结果
形成可复用的工程 Agent 路径:理解零件、检索相似任务、提出工艺并生成报价建议,每一步都保留可检查的依据。

多模态模型 · 数据运营

模型与数据闭环

把数据、训练、评测、部署和线上反馈连成可追溯、可复现的模型生命周期。

  • 120+个数据集
  • 200 万+标注图像
  • 99.5%识别准确率
挑战
在持续提升多模态识别效果的同时,确保每一次数据、训练、评测和部署过程都可以复现。
角色
负责模型体系、云端推理、标注训练平台和工程交付的软件算法负责人。
关键决策
围绕数据版本、标注、实验、评测基线、部署产物和线上反馈建立生命周期。
系统
120+ 数据集、200 万+ 标注图像、100+ 模型产出,以及从采集到生产反馈的连续链路。
结果
识别准确率从 92% 提升至 99.5%,推理速度提升 50%。

计算机视觉 · 模型生命周期

EvoAI 视觉模型工作台

用一套可私有化部署的工作台,承接数据导入、标注、训练、测试和推理交付。

  • 4 类任务分类、检测、分割、异常
  • ONNX标准模型交付
  • 私有部署数据与运行边界
挑战
工业视觉项目依赖分散脚本和人工传递,数据、训练与交付彼此割裂。需要用同一套系统承接原始数据,并产出可训练、可测试、可交付的模型。
角色
负责从产品工作流、系统架构到训练运行时和交付边界的整体设计与实现。
关键决策
以项目和当前数据集为主线,统一数据状态、标注、训练任务、模型产物和测试反馈。大文件导入和训练做成可恢复的异步任务。
系统
覆盖分类、检测、分割与异常检测,包含数据导入、图像标注、训练任务、模型注册、单图测试、结果回流,以及 ONNX 与 Windows 推理交付。
结果
形成可私有化部署的视觉工作台,使数据、训练、模型和部署产物始终处于同一条可追溯链路中。

强化学习 · 机器人 · 实时视觉

强化学习、机器人与实时 AI

从分布式策略训练、机器人 Web 控制到大规模视觉检测,处理实时环境中的感知、决策与回传。

  • 1500+CPU 核训练
  • 300台设备并发
  • 99%异常检测准确率
挑战
复杂在线环境既需要训练决策策略,也需要连接机器人控制、视觉感知和设备状态;各环节共享实时系统基础,同时保持清晰的安全边界。
角色
负责环境、分布式学习、视觉感知、评测与生产部署的算法研究员。
关键决策
将环境保真、策略学习、UI 感知和线上评测分开设计;异常检测则围绕可量化的运维验收构建,而不是只关注单次准确率。
系统
使用 1500+ CPU 核的分布式强化学习平台,构建 AGV 与机器狗的 Web 控制、实时轨迹和相机回传原型,并交付支持 300 台设备并发的视觉异常检测服务。
结果
UI 驱动的游戏 Agent 达到钻石 9;完成机器人远程控制与状态回传验证;视觉异常检测准确率 99%,检测时间缩短至 30 分钟。

长期上下文 · 多角色 Agent

长期个人 AI 与多角色协同平台

让上下文跨时间延续,让工具在权限内读写真实记录,并为关键判断保留人的确认。

  • 时态记忆事实版本与遗忘
  • 角色隔离身份与数据边界
  • 人工确认关键动作可控
挑战
个人 AI 需要理解随时间变化的事实、偏好、目标和真实行为,同时严格守住不同身份、角色与数据之间的边界。
角色
负责 Agent 运行时、领域模型、数据与记忆架构、AI 工具链和生产交付体系的整体设计与持续演进。
关键决策
将聊天历史、当前事实、业务记录、知识证据和临时执行状态分开建模;长期记忆按身份与对象隔离,事实变化通过版本更新表达,遗忘过程可审计,重要判断保留人工确认。
系统
流式 Agent、结构化工具调用、时态长期记忆、向量召回、知识检索、多模态输入、长期记录、多角色权限、审计、幂等与安全策略。
结果
对话能够跨时间延续,工具能够在权限内读写真实记录,同时让 AI 建议、确定性规则和人的决策保持清晰边界。
  • 身份隔离
  • 证据可追溯
  • AI 与规则分离
  • 关键环节人工确认

围绕 AI 团队建设、Agent 平台规划与生产落地等问题,可通过 xujiayu0606@gmail.com 联系。