Padmi

AI 模型工程师

ChinaPosted 1 month ago
Software engineeringUnspecified
Apply at Lenovo

Opens the source posting on jobs.lenovo.com

Source description

About the role

View original

We are Lenovo. We do what we say. We own what we do. We WOW our customers. Lenovo is a US$83 billion revenue global technology powerhouse, ranked #196 in the Fortune Global 500, and serving millions of customers every day in 180 markets. Focused on a bold vision to deliver Smarter Technology for All, Lenovo has built on its success as the world’s largest PC company with a full-stack portfolio of AI-enabled, AI-ready, and AI-optimized devices (PCs, workstations, smartphones, tablets), infrastructure (server, storage, edge, high performance computing and software defined infrastructure), software, solutions, and services. Lenovo’s continued investment in world-changing innovation is building a more equitable, trustworthy, and smarter future for everyone, everywhere. Lenovo is listed on the Hong Kong stock exchange under Lenovo Group Limited (HKSE: 992) (ADR: LNVGY). This transformation together with Lenovo’s world-changing innovation is building a more inclusive, trustworthy, and smarter future for everyone, everywhere. To find out more visit www.lenovo.com , and read about the latest news via our StoryHub . 岗位职责: 一、训练数据构建方向 1. 业务需求拆解与技术落地:对接业务BU与产品团队,精准解析业务与产品诉求,将业务需求转化为标准化、可落地、可量化的数据技术方案,支撑模型迭代与业务落地。 2. 训练数据全流程制备:配合模型训练团队完成大模型训练数据建设,涵盖通用文本、专业语料、图文、视频等多模态数据的筛选、加工与产出,保障 SFT、RL 等各阶段数据供给。 3. 数据处理 Pipeline 建设与迭代:设计、开发、优化大模型专属数据处理流水线,覆盖数据采集、清洗、过滤、去重、质量校验、质量打分、分层存储等全链路流程,持续提升数据生产效率与数据质量,满足模型多版本迭代需求。 4. 数据集版本管理与合规溯源:基于 Git、DVC 完成海量训练数据集的版本管理、迭代追踪与实验归档;完整沉淀数据来源、处理规则、变更记录,实现训练实验可复现、数据可溯源、可审计,满足业务合规要求。 二、模型评测方向 5. 大模型全维度评测:负责业界主流文本大模型(LLM)、多模态大模型(VLM)及内部微调迭代模型的全维度评测,支撑业务模型选型决策。 6. 业务专属评测体系搭建:对接各业务线需求,联合业务方制定模型验收标准;按需搭建业务专属评测数据集、设计量化评价指标,确保评测结果贴合真实业务落地场景。 7. 评测基准维护与扩充:统筹自有数据集、开源评测数据集的维护扩充,搭建并持续迭代标准化大模型评测基准体系。 8. 评测平台与流水线建设:参与统一自动化评测平台、评测流水线的设计与开发,承担流水线日常运维、功能迭代与调度性能优化工作。 9. 快速验证与效果回归:紧密协同模型训练团队,对每一轮迭代模型完成快速验证、效果回归评测,缩短模型调优评测周期。 三、数据—评测闭环 10. 模型迭代数据闭环优化:持续跟进模型线上推理效果与评测结果,挖掘模型 Bad Case、能力短板与低质量样本;反向驱动数据迭代,针对性补充高价值、高难度样本、优化劣质语料,形成“数据构建—模型评测—Bad Case 反馈—数据迭代”的完整闭环。 通用能力 工程能力扎实: 精通 Python 数据/工程开发生态,熟悉 Linux 开发环境,熟练编写高效、稳健、可复用的脚本,具备大规模、多类型数据批量处理实战能力。 AI 高效研发能力: 熟练使用 Cursor、Claude Code 等 AI 辅助编程工具,能够高效完成代码编写、调试、重构与问题排查,显著提升研发效率。 英文能力: 具备良好的英文阅读与沟通能力,可独立阅读海外开源数据集/评测基准、技术文档与前沿论文,可支撑跨团队英文邮件及会议沟通;口语流利者优先加分。 自驱力与学习能力: 具备较强自驱力,能够自主研读论文、跟进技术社区,同步行业前沿数据与评测方案、新技术。 数据方向要求 数据版本与工程协作能力: 熟练掌握 Git、DVC 工具链,具备海量数据集版本管理、实验追踪、多分支协同开发经验,保障数据资产与实验流程规范化。 大模型数据体系认知: 深入理解大模型各类训练数据生产规范,熟练掌握 SFT 指令微调数据、RLHF 偏好对比数据、多模态图文/视频配对数据的构建标准与质量体系。 评测方向要求 评测落地经验: 具备 LLM / 多模态大模型实测评测落地经验,理解大模型基础原理,深耕或有意长期研究文本、多模态大模型评测技术方向。 评测工具与推理框架: 熟悉主流大模型评测工具与推理框架,如 OpenCompass、VLMEvalKit、vLLM、SGLang 等,有实操使用经验优先。

One address, no account. We’ll tell you when matching roles go live.

More at Lenovo

Related open roles

View all roles