高级全栈开发工程师(Token 工厂基础设施)
一、岗位职责
1.负责 Token 工厂/ MaaS 平台核心基础设施开发,完成多模型统一路由、Token 级限流熔断、混合算力调度、Token 实时计费等核心模块的设计与实现,构建高吞吐、低延迟、高可用的大模型推理服务网关,实现第三方厂商 API 中转与自有 GPU 算力集群的统一混合调度。 2.负责平台算力运维体系建设与开发,完成 GPU 算力集群的接入纳管、节点注册与状态感知,推进 vLLM / SGLang 推理引擎的自动化部署、版本灰度、弹性伸缩及故障自愈能力建设,实现 GPU 节点负载、显存水位、队列深度等算力状态的实时感知与动态调度。 3.负责平台前后端一体化开发,涵盖需求分析、技术方案设计、接口开发、运维管控面开发、联调测试及生产环境部署;重点建设中后台的算力监控、Token 用量分析、成本核算、告警治理等运维支撑能力。 4.负责模型服务全生命周期管理,包括模型上架/下架、版本灰度、A/B 测试、性能基准测试、推理优化(量化、投机解码、KV-Cache 压缩与管理等),保障模型在分布式 GPU 集群上的推理性能与稳定性。 5.负责平台用户体系与商业化支撑能力建设,包括多租户隔离、API-Key / Token 配额管理、阶梯计费策略、用量审计、账单结算等,支撑平台从模型 API 转发层向 Token 生产与运营平台升级。 6.负责算力成本优化与可观测体系建设,基于 Prometheus / Grafana 构建 GPU 利用率、显存占用、Token 首字延迟 / 端到端延迟、队列深度、SSE 流式链路稳定性等核心指标监控大盘,推动算力资源的高效利用与成本可控。 7.高效使用 AI 编程工具完成需求拆解、架构设计、代码开发、重构优化、测试与文档工作,提升基础设施研发效率与交付质量。
二、任职要求
1.本科及以上学历,计算机、软件工程、人工智能等相关专业,3年及以上后端 / 基础设施开发经验;有 AI 基础设施、模型网关、MaaS 平台或智算算力调度平台开发经验者优先。 2.扎实的后端系统开发能力,精通 Rust 语言,具备大型 Rust 项目生产级开发实战经验;熟悉 Tokio 异步运行时与 Axum / Actix-web 等 Rust Web 框架;熟悉高并发系统架构、异步非阻塞 IO、分布式系统原理,可独立完成核心模块的设计与开发。 3.深入理解大模型 API 网关底层机制,包括请求路由、SSE 流式响应代理、Token 级限流熔断、故障转移、多模型负载均衡、OpenAI 协议归一化适配等;有模型网关类开源项目二次开发、源码改造、自定义 Provider / 路由策略扩展经验者优先。 4.熟悉 GPU 算力基础设施,了解 CUDA 生态,具备 vLLM、SGLang 推理引擎的部署调优、容器化编排、弹性伸缩实战经验;理解自有算力节点与第三方 API 混合调度架构的设计与落地。 5.熟悉前端技术栈,能够基于 Vue 3 / TypeScript 独立完成运维管控台、配置管理、监控大盘等前端模块的开发,具备完整的前后端联调与线上问题排查能力;有 Dioxus、Leptos 等 Rust 前端框架经验者优先。 6.熟悉云原生可观测体系,熟练使用 Prometheus、Grafana,能够独立搭建监控告警、指标埋点、链路追踪体系,具备生产环境故障排查与性能调优的实战经验。 7.具备 AI 原生开发意识,熟练运用 AI 编程工具辅助编码、重构、调试与文档输出,提升基础设施研发交付效率。 8.具备良好的逻辑分析、问题排查与跨团队协作能力,能够主动推动项目落地;对 Token 经济性、GPU 算力成本优化具备敏感度与落地实践经验。
三、优先考虑
1.有 Rust 全栈开发经验,同时具备后端网关层与管控面前端的完整模块交付能力。 2.有模型 API网关/ Token工厂/ MaaS平台从0到1搭建与落地经验,或有大模型网关类开源项目源码级改造经验(包括自定义Provider开发、路由权重策略扩展、流控中间件定制等)。 3.有智算中心、GPU 集群运维调度、异构算力混跑调度等相关项目经验。 4.有 vLLM、SGLang推理引擎的部署调优、性能调优、二次适配开发经验。 5.有大规模SSE流式请求高并发处理、多租户精细化计费、Token 级成本核算等项目的实战经验
有意向请简历发送到:alan@phanlink.cn ,可加微信:alan__pai (请备注来意)
评论区
写评论还没有评论