工作经历
2021/03至今
某头部互联网公司 AI平台部
高级机器学习工程师北京
负责公司级AI中台的设计与建设,主导大模型推理服务化及多业务线模型训练平台升级。带领5人团队支撑日均百亿级请求的推荐与搜索场景,推动模型迭代周期从周级缩短至天级。 主导AI中台架构升级,实现模型全生命周期管理 负责大模型推理性能优化与成本治理 建立模型评测体系与回归测试流程 推动AI协作式研发工作流在团队内落地
大模型推理服务化平台
- 针对公司内多个业务线对大模型推理的需求,设计并实现了支持多模型并发、动态扩缩容的推理服务平台。平台支持GPT系列、BERT系列及自研模型的统一接入,解决高并发下的延迟与稳定性问题。
- 基于Kubernetes的容器化部署,采用Triton Inference Server作为推理引擎,结合Redis集群做请求缓存,使用Prometheus+Grafana实现全链路监控。模型层支持ONNX/TensorRT/自研格式,服务层采用gRPC与HTTP双协议暴露。
- 作为技术负责人,完成整体架构设计、核心模块开发及团队任务分配。具体负责推理引擎选型、性能基准测试、缓存策略设计,以及生产环境灰度发布方案制定。
- 技术栈: Triton Inference Server TensorRT加速 Kubernetes调度 gRPC服务治理 Prometheus监控 模型量化压缩 动态批处理
- 挑战: 推理延迟降低65%: 通过TensorRT FP16量化、动态批处理及KV Cache优化,将单请求平均延迟从320ms降至110ms,P99延迟从800ms降至280ms
- 挑战: 成本下降40%: 设计模型路由与降级策略,结合请求特征做智能缓存命中,GPU利用率从45%提升至78%,年度推理成本降低约1200万元
- 挑战: AI协作式研发实践: 引入Claude Code与GitHub Copilot构建辅助工作流:使用Claude Code进行复杂模块的任务拆解与方案设计,借助Copilot完成单元测试生成与样板代码补全。所有AI生成代码经本地pytest验证、SonarQube扫描及人工CR后合并,未出现因AI引入的生产故障
实时特征平台重构
- 重构原有离线T+1特征计算体系,建设支持秒级更新的实时特征平台,为推荐、广告、风控等业务提供低延迟特征服务。
- 采用Flink+Kafka的流处理架构,特征存储使用Redis Cluster与Aerospike混合方案,特征血缘通过自研元数据系统管理。接入层提供统一SDK,支持特征回溯与在线 Serving。
- 负责实时特征计算引擎开发,设计特征一致性校验机制,实现特征质量自动监控与异常告警。主导Flink作业的性能调优,解决状态后端过大导致的Checkpoint超时问题。
- 技术栈: Flink实时计算 Kafka消息队列 Redis Cluster 特征工程 Aerospike 链路追踪 A/B测试
- 挑战: 特征更新时效性提升: 核心特征更新延迟从24小时缩短至5秒内,推荐场景CTR提升12.3%,广告RPM提升8.7%
- 挑战: 特征质量保障体系: 建立特征分布漂移检测、缺失值自动填充、样本与特征一致性校验三层防护,特征问题导致的线上事故下降90%
2017/072021/02
某金融科技公司 智能风控部
机器学习工程师上海
负责信贷风控模型的研发与部署,从0到1搭建模型训练与监控体系。支持日均千万级授信决策,模型KS指标保持行业领先水平。 独立完成信用评分卡、反欺诈等核心模型开发 搭建模型自动化训练与部署流水线 设计模型监控与漂移预警机制
智能信贷审批系统
- 构建覆盖贷前、贷中、贷后的全流程智能风控体系,实现自动化授信决策与动态风险定价。模型需满足监管可解释性要求,同时平衡审批通过率与坏账率。
- 采用XGBoost+LightGBM的集成模型方案,特征工程层使用Spark进行大规模离线计算,模型服务通过Flask+Docker部署,数据库采用PostgreSQL与ClickHouse组合。
- 负责信用评分模型开发,完成特征衍生与筛选、模型训练调优、阈值策略制定。设计并实施模型监控Dashboard,跟踪PSI、KS等核心指标变化。
- 技术栈: XGBoost LightGBM Spark大数据处理 特征工程 模型可解释性 Docker容器化 ClickHouse
- 挑战: 审批效率提升: 自动化审批率从60%提升至85%,单笔审批耗时从平均15分钟降至3秒,人工复核工作量减少70%
- 挑战: AI协作式研发早期实践: 在团队内试点GitHub Copilot辅助SQL与Python代码编写,结合Cursor进行复杂逻辑的重构。建立AI辅助代码的强制审查清单:必须包含边界条件测试、异常处理、输入校验,禁止直接合入AI生成的敏感权限相关代码
反欺诈规则引擎升级
- 将原有硬编码规则升级为规则+模型融合的决策引擎,支持规则热更新与模型版本灰度,提升欺诈识别准确率与响应速度。
- 规则引擎基于Drools实现,模型层接入实时特征流,决策层支持规则优先级动态调整与A/B测试。使用Elasticsearch存储决策日志,Kibana做可视化分析。
- 负责规则引擎与模型层的对接开发,设计决策结果一致性校验机制,完成灰度发布方案实施。
- 技术栈: Drools规则引擎 实时决策 Elasticsearch Kibana 灰度发布 A/B测试
- 挑战: 欺诈识别率提升: 模型融合后欺诈识别率从72%提升至89%,误杀率从5%降至2.1%,年度减少欺诈损失约800万元