Public resume
联系 · qjianxun0@gmail.com

后端 / Agent
开发工程师

近 10 年后端与平台工程经验,最近 3 年聚焦 AI Infra、LLM Platform 与 Agent Runtime, 覆盖系统设计、核心实现、云上交付和生产稳定性治理。

  1. LLM Gateway 01
  2. Agent Runtime 02
  3. Sandbox & Tools 03
  4. Async Infrastructure 04
  5. Observability 05
Go / Python OpenAI / Anthropic Tool Calling MCP / Custom Widget OpenTelemetry AWS / Cloudflare
01

近期重点经历

围绕 LLM Platform、Agent Runtime 与平台基础设施建设生产级 AI 应用后端。

myshell.ai

AI Infra / LLM Platform / Agent Runtime / 后端工程

2023.07 — 至今

负责 AI Bot / Agent 平台后端与基础设施研发,围绕多模型网关、Agent Runtime、隔离 Sandbox、工具调用、 异步任务基础设施和端到端可观测性建设生产级 AI 应用平台,并参与核心后端从 NestJS 向 Go / Kratos 渐进式迁移。

Project 01 · Primary case

统一 LLM Gateway 与多模型协议治理

Client API → LLM Proxy → Provider Adapter → SSE / Trace

  • 主导从 0 建设 FastAPI LLM Proxy,同时提供 OpenAI-compatible Chat Completions 与 Anthropic Messages API,适配 OpenRouter、AWS Bedrock、Azure OpenAI 等模型后端,支持 SSE 流式输出、Tool Calling、多模态消息及 reasoning / thinking 参数。
  • 统一不同 Provider 的模型、参数、错误与响应协议,处理并行工具调用的消息顺序约束;实现鉴权、余额检查、Token / Cached Token / Cost 计量和 Prompt Cache。
  • 建设 Request ID、错误映射和 LLM Trace,解决 StreamingResponse 异步生成器丢失父 Span 的问题,维护流式请求的完整 Trace 生命周期。
Project 02 · Primary case

ShellAgent / Text2App Control Plane 与 Runtime

Control Plane → WebSocket → Sandbox → Agent Session / Tool

  • 负责 Agent Control Plane 与 Runtime 关键链路,建设 MCP / Custom Widget 工具发现与版本管理、Bot Deploy / Rollback、Server ↔ Sandbox WebSocket,以及 Telegram Webhook → SNS / SQS → Modal Sandbox → AI 回调执行链。
  • 建设按 Bot / 用户隔离的 Sandbox、Session、Snapshot 和持久 Volume,支持健康检查、容量背压、断线重连、状态恢复、定时 Agent Task,以及文本、语音、图片、视频和文件等多模态输入输出。
  • 以 OpenTelemetry 贯通 HTTP、WebSocket、线程 / 异步任务、Agent Session、Modal Sandbox、Widget、消息队列和 MySQL,并关联日志 trace-id、消费耗时和排队延迟。
Project 03

Telegram Agent Runtime 与多业务 Bot Gateway

Webhook → Queue → Channel Adapter → Business Processor

  • 主导 Tg2App / ClawdBot Agent 执行后端,通过 SNS / SQS 解耦 Webhook 与长耗时 Agent 任务,以用户级 Redis 锁保证消息顺序,并实现可靠文件上传、失败重试和定时任务。
  • 从 0 设计 ShellChannel 多业务 Bot Gateway,以统一消息模型、Channel Adapter 和业务 Processor 解耦 Telegram 协议与 AI Bot,支持命令分流、历史上下文、安全约束、Fallback、TTS 和多模态消息。
  • 建设 Telegram Stars 支付闭环,覆盖 Invoice、Pre-checkout、Successful Payment、订单状态 CAS 和权益发放,通过状态预检治理重复回调与数据库锁竞争。
Project 04

平台 Infra、用户增长与异步任务基础设施

Producer → SNS / SQS → Consumer Runner → Sandbox Capacity

  • 设计并落地邀请裂变、分享归因与积分奖励底座,统一个人 / KOL 邀请码及 Bot / Message / Widget 分享码在注册登录链路的关系绑定、奖励发放和行为归因;通过分布式锁、事务、库存条件扣减、自邀 / 重复使用校验保障并发一致性,并接入风控和行为埋点。
  • 设计 AWS SNS Producer / Message Sender 基础库,统一事件封装、Async Job ID、错误语义和 Trace / Baggage 传播,并支持 FIFO 消息分组与去重,降低不同业务接入消息队列的重复开发成本。
  • 抽象 AWS SQS Consumer Runner,统一长轮询、并发控制、超时、信号退出、ACK 和 Trace;普通消息失败不 ACK、依赖可见性超时重投,Async Job 通过条件状态迁移、最大重试次数和 deadline 实现有界重试。
  • 建设消息链路可观测与容量保护能力,记录排队延迟、处理耗时和 Queue Lag,并根据运行中 Sandbox 数量暂停 / 恢复消费,避免突发任务压垮 Agent Runtime。
Project 05

Go 平台重构、稳定性治理与云上交付

NestJS → Go / Kratos → ECS / Cloudflare → Observability

  • 参与 Bot 发布 / 下架、Chat 消息翻译、Use Code、Async Jobs 等核心模块从 NestJS 向 Go / Kratos 的分阶段迁移,处理旧接口业务语义、数据模型和兼容边界。
  • 围绕 LLM 流式请求、WebSocket、MySQL 与支付链路建设 OpenTelemetry Trace、看板和告警,治理断线重连、Provider fallback / retry、慢 SQL、连接池、锁竞争和幂等补偿等生产问题。
  • 推动 ShellAgent 由 EC2 向 ECS 容器化迁移,落地 Cloudflare Workers / Pages,并接入 AWS Bedrock、S3、SES 等云服务。
  • 优化 Go 项目 CI / Lint 流程,通过调整 GC、Linter、依赖缓存和扫描范围,将执行时间从 15 分钟以上缩短至约 3.5 分钟。
其他:支付与 Web3
  • 建设 Stripe 订阅支付后端,通过 Webhook 签名、订单状态机、主动查单和 Cron 补偿保证订单与权益最终一致性。
  • 反爬虫系统建设、接口签名算法设计、恶意流量处理等。
  • 建设 Linea / opBNB 链上任务后端,完成既有合约 Event 扫描、确认区块与断点游标、txHash 幂等落库及 ERC-20 奖励批量发放。
02

证据 / 能力索引

先看生产案例,再以职业定位与能力范围快速校准匹配度。

职业定位

面向生产级 AI 应用的后端与平台工程,关注模型协议、Agent 执行链路、异步基础设施、 数据一致性与可观测性,而不止于业务接口实现。

10 年+后端与平台工程实践
3 年AI Infra / Agent Runtime
E2E设计、实现、迁移、稳定性治理

核心能力

以 Agent 后端为主线,同时具备成熟的平台、数据与分布式任务经验。

LLM 与 Agent

多模型网关、OpenAI / Anthropic 协议、SSE、Tool Calling、多模态、Prompt Cache、Token / Cost、Agent Runtime、MCP、Sandbox。

后端工程

Go、Python、PHP;Kratos、FastAPI、Gin、Flask、NestJS;服务重构、接口迁移、并发控制与灰度兼容。

数据与异步系统

MySQL、Redis、MongoDB、Elasticsearch、Kafka、AWS SNS / SQS;幂等、ACK、重试、状态机与任务容量保护。

云与稳定性

OpenTelemetry、AWS ECS / Bedrock / S3、Cloudflare Workers / Pages;Trace、看板告警、长连接恢复与 CI 优化。

03

专业经历

从大规模数据采集、内容平台与审核系统,持续演进到 AI / Agent 平台工程。

2023.07 — 至今

myshell.ai

AI Infra / LLM Platform / Agent Runtime / 后端工程

当前经历包含 5 个重点项目及“支付与 Web3”补充,已在本页上方完整展开。

返回 MyShell 完整项目经历 ↑
2022.03 — 2023.07 Shopee 资深软件工程师 2 个项目 · 11 条职责
Project 01

Video 回查系统

个人负责该系统架构设计和实现,使用 Go 语言和内部 RPC 框架提供核心接口,采用 Gin 提供 HTTP 接口,支持多国家业务发展需求。

系统主要供运营人员快速查询 Video 从用户发布到搜索推荐经过的完整审核链路,包括不同机审模型结果、人审队列结果、打标、免审等事件,便于回溯审核历史和排查 Case。

  • 拆分为 RPC 和 Portal 两个服务:RPC 负责事件接入、数据存储和检索等核心功能,Portal 负责提供 HTTP 接口和权限控制。
  • 使用 Elasticsearch 存储 Video 和 User 核心检索数据,提供多维度检索。
  • 接入 Binlog 同步内容变更并发送对应事件,后端获取完整信息后存储到 Elasticsearch。
  • 使用 MySQL 分表存储 Video Trace 记录,以 videoID 为分片键。
  • 使用 Kafka 作为消息队列,实现服务解耦和突发流量控制。
  • 改造服务支持多国家业务,通过在 ALB 中设置 cid 并透传到下游服务,读取不同国家的配置信息。
Project 02

人审系统重构

  • 负责 Gateway 服务和 Portal 服务的设计与实现。
  • 支持消息队列和 RPC 两种进审方式。
  • 对业务接入方进行权限校验和流量控制,防止大促等突发流量影响下游系统。
  • 通过配置化方式支持 Video、Account、Hashtag、Music 等多种物料。
  • 提供多维度统计 Dashboard,提升人审效率。
2020.07 — 2022.02 陌陌科技 高级爬虫工程师 3 个项目 · 18 条职责
Project 01

服务端 API

个人负责业务技术栈,主要使用内部 PHP 框架,部分服务采用 Go。

  • 推进完成内容表的分库分表,根据检索条件进行多维度分库分表。
  • 主导对接阿里云 OpenSearch,提供搜索、排序、打散和置顶相关能力。
  • 完成对话素材去重,评估内存占用后使用 Redis Bitmap 实现。
  • 完成频道订阅和不感兴趣标签功能。
  • 完成用户金币账户体系,支持抽奖、兑换奖品等功能。
  • 优化 AI 变脸和语音合成等功能的性能,主要采用缓存和版本号方案。
  • 建设关注 Feed 服务,使关注列表实时展示关注用户、话题和收藏夹下更新的内容。
  • 借助 Elasticsearch 提供初期的多轮对话能力。
  • 支持站内活动、打卡、签到和抽奖等业务。
Project 02

运营后台

使用 Golang 开发,Web 框架使用 Gin。

  • 通过 JWT 进行接口认证。
  • 使用 Wire 解决依赖注入问题。
  • 底层存储涉及 MySQL 和 MongoDB。
  • 后期将检索能力优化为 Elasticsearch。
  • 数据变更同步采用消息队列方式。
  • 支持统计报表数据需求。
Project 03

内容数据引入

成果:引入视频和图片等资源 500 万+,同步部分 Instagram 账号内容。

  • 通过 Python Web 框架提供 API,供后台配置数据引入规则。
  • 爬虫作为 Consumer 获取任务并消费数据,完成下载、上传和转码等后续处理。
  • 格式化最终结果并发送到消息队列,进入后续去重和打标流程。
2018.03 — 2020.06 北京云动九天科技有限公司 数据智能 / 爬虫工程师 5 个项目 · 21 条职责

主要产品:省钱快报 App,属于电商导购类产品,对接淘宝、京东、拼多多等平台,日活用户 300 万+。

Project 01

分布式爬虫任务调度系统

成果:负责 80+ 爬虫、200+ 队列的任务调度,日调度任务超过 5 亿次。

  • 通过 HTTP 接口进行爬虫和任务队列注册,支持设置最大队列大小、单个任务队列抓取速度和监控报警阈值。
  • 支持多节点部署,自动检测节点添加和异常退出,提高调度能力和可用性。
  • 动态调节不同队列的抓取速度,提高代理利用率。
  • 支持优先级任务组,自动控制待调度队列的整体大小。
Project 02

Cookie 池服务和通用模拟登录平台

成果:管理淘宝爬虫使用的 Cookie,支持淘宝等网站的模拟登录,降低环境搭建成本,并向实时优惠引擎和招商计划等业务提供 Cookie。

  • 通用 Cookie 使用 Redis 构建环形队列,特殊账号使用 Hash 结构存储。
  • 使用 Puppeteer 和 Express 搭建常见网站的登录服务平台。
  • 移除浏览器特征,并支持模拟移动端。
  • 支持执行 JavaScript 脚本,通过脚本模拟点击和滑动验证码等交互。
Project 03

淘宝优惠信息实时引擎

成果:提供 15+ 种优惠信息,包括店铺券、满减满折和红包等,覆盖商品 400 万+。

  • 研究淘宝反爬虫策略,开发通用淘宝 Sign 解密和 Cookie 使用中间件等进行规避。
  • 持续优化数据链路,挖掘不同接口关系,通过历史数据分析字段含义,降低代理使用成本并防止任务积压。
  • 对接 Feed、商品点击、搜索等不同数据源,及时发现商品的新优惠类型。
  • 建设 Scrapy 分布式抓取集群,并使用 ScrapydWeb 管理平台。
Project 04

商品库建设

成果:每日对 7000 万+ 商品完成多次更新。

  • 重构商品库系统,将爬虫脚本迁移到 Scrapy,使用 Kafka 解耦,并将数据发送到 Kafka 供中台和搜索等业务消费。
  • 对商品库进行分层,包括秒杀、曝光商品和商品打分机制等,针对不同层级采用不同更新频率,降低信息延迟。
  • 二次开发 scrapy-redis,使用 Pipeline 支持批量获取任务,爬虫整体性能提升约 30%。
  • 利用不同接口对商品价格进行验证,提升价格准确性。
  • 优化数据链路,使用 Redis Hash 对商品不同维度的 Kafka 消息去重,日去重超过 1.5 亿。
  • 建设新任务过滤器模块,以配置化规则过滤敏感词、类目黑名单和发货时间过长的商品,提升灵活性。
Project 05

爬虫监控 / 数据持久化

成果:使用 InfluxDB、Grafana、Fluentd 等工具构建监控数据平台。

  • 构建 Scrapy 扩展,统一收集爬虫指标。
  • 使用 Fluentd 收集爬虫核心业务数据并写入 MongoDB 集群。
  • 优化 MongoDB 集群性能,不使用 TTL 特性,改为按天分割数据。
2017.01 — 2018.02 北京星河金服科技有限公司 大数据风控中心 / 爬虫工程师 2 个项目 · 8 条职责

公司性质:互联网金融。

Project 01

全国企业工商数据抓取

成果:完成风控系统对企业评分所需的数据需求。

  • 结合待采集网站特性进行技术选型,使用 pyspider 作为抓取框架、Redis 作为消息队列、MySQL 作为数据存储。
  • 完成 100+ 数据源采集,包括 58 同城、1688、信用中国和水滴信用等,覆盖招聘、信用黑名单、企业信息等网站,完成 5000 万企业基础信息采集。
  • 使用 Scrapy 和 scrapy-redis 动态补充企业信息,并完成相关接口解密。
  • 完成数据报表相关模块开发。
Project 02

个人征信数据抓取

  • 完成学信网、电信运营商、北京社保、脉脉等数据源的采集任务。
  • 使用 Django 搭建爬虫端查询后台,并开发添加爬虫任务的相关 API。
  • 使用 Selenium 抓取复杂的动态渲染页面,降低逆向 JavaScript 的成本。
  • 采用 OpenCV 进行学信网图片识别。
04

开源与工程实践

保留开源项目贡献内容,不在公开页面展示个人代码托管账号。

pyspider

贡献基于 Puppeteer / Express 的网页渲染抓取组件,支持 Cookie 初始化和传入脚本执行点击、滑动等交互。

scrapy-redis

将 start_urls 从单条读取优化为批量读取,并扩展有序集合任务队列以支持优先级场景。

influx-proxy

围绕指标采集与数据代理进行工程实践,与大规模爬虫监控体系结合。

rosedb

修复 String 数据结构 Key 过期相关问题,参与存储组件缺陷修复。

把 Agent 能力落到可靠、可观测、可持续演进的生产系统中。

具备从需求拆解、架构设计、核心实现、灰度迁移到稳定性治理的端到端交付能力,重视幂等、一致性、故障恢复与工程边界。