2026年哔哩哔哩职级与薪资体系,附AI测试开发面试题

简介: 本文详解B站职级体系、薪酬结构(含年包构成与绩效机制)及AI测试开发面试核心题(RAG评测、Agent测试、MCP集成等),覆盖从求职定位到工程落地的全链路准备,助力技术人员精准评估机会、高效备战面试。

哔哩哔哩(Bilibili,简称B站)的业务覆盖视频、直播、游戏、广告、会员等领域。对于考虑进入B站的技术人员,最先想了解的往往是三件事:职级怎么分、年薪大概多少、面试需要准备什么。

先看B站职级、年薪和绩效机制,再进入AI测试开发技术面试题。

一、B站职级体系与公开薪酬水平
在公开薪酬记录中,可以看到1、2-1、2-2、3-1、3-2、3-3、4-1等职级编号。

这些编号出现在技术研发、产品经理、运营等岗位中,具体职责还要结合岗位序列判断。

  1. B站不同职级年薪多少?
    职级
    岗位
    年薪
    2-1
    技术研发
    48万元
    2-2
    技术研发
    55.5万元
    3-1
    运营
    61万元
    4-1
    产品经理
    257.5万元
    这四条公开报薪记录的工作地点均为上海。

2-1与2-2属于技术研发岗位,年薪分别为48万元和55.5万元;3-1为运营岗位,年薪61万元;4-1为产品经理岗位,年薪257.5万元。

职级只是了解岗位的一个入口。技术研发岗更值得关心的,是实际负责哪些系统、项目难度有多大,以及年包的构成。

  1. 相邻职级的样本差额
    2-1与2-2两条技术研发记录相差7.5万元,差幅约15.6%。

从2-2技术研发到3-1运营记录,相差5.5万元,约9.9%。

这两组差额对应的是不同人的收入记录,其中3-1还是运营岗,因此15.6%和9.9%都不能直接理解为晋升涨薪比例。

对测试开发、后端研发等求职者来说,同样的职级编号下,岗位是偏业务交付、专项质量保障,还是平台工程建设,通常会影响实际的职责要求和薪酬谈判。

二、B站薪酬结构:年包不只是月薪
B站公开的ESG报告介绍了“以能定级、以级定薪、以功定绩、以绩定奖”的薪酬管理原则。

看到年包数字时,可以先把它拆成几部分。

薪酬项目
谈Offer时重点确认
固定月薪
税前金额、固定发薪月数
绩效/年终奖
目标金额、考核方式、发放时间
股权激励
授予形式、归属周期、兑现条件
其他福利
补贴、保险、休假等具体政策
举个例子,两份Offer都写着年包50万元,一份固定现金占比较高,另一份则包含较多绩效奖金或股权。数字一样,收入的稳定性却可能不同。

拿到Offer后,先确认保底现金,再看绩效奖金如何兑现,最后核对长期激励。

这样比单纯比较“多少万年包”更容易判断两份机会的差别。

三、B站绩效考核与员工发展
B站公开的ESG报告显示,公司将360度绩效评估扩展至全体员工,并继续使用OKR促进目标对齐与协作。

公开披露的绩效流程包括:

① 员工自评

② 360度反馈

③ 主管评价与上级校准

④ 结果沟通

⑤ 绩效申诉

图片

落到技术岗位,绩效讨论通常离不开工作交付、复杂问题解决、协作推动等具体成果。

例如,是否按期完成关键需求,能否解决影响线上稳定性的技术问题,或者是否通过测试平台、自动化流程减少了重复工作。

求职时可以进一步问清楚:团队主要负责哪些系统?试用期和年度目标是什么?怎样评价一个测试开发工程师的工作成果?

这些问题有助于判断岗位是否适合自己。

四、AI测试开发面试题:从概念走向工程实践
结合霍格沃兹测试开发学社学员的面试交流,我们把常见的技术考察方向归纳为8道题,重点放在大模型应用、RAG评测、Agent执行、工具集成与自动化工程。

面试题①:AI生成测试用例,怎样评估生成质量?
参考回答:

首先看需求覆盖率,其次检查用例准确性、重复率和可执行性。

比如登录功能,除了正确账号密码,还要覆盖账户锁定、验证码过期、接口超时和异常权限。

实际落地时,可以建立“需求—测试点—测试用例”的映射关系,先用人工审核的标准用例集作为基线,再计算覆盖情况;对支付、权限等高风险场景保留人工复核。

面试题②:RAG知识库应该怎么测试?
参考回答:

RAG要分开测检索和生成。

文档解析阶段检查正文、表格与元数据是否丢失;检索阶段关注Recall@K、Precision@K及相关文档排序;生成阶段检查答案准确性、事实依据和引用是否正确。

例如用户问“年假怎样计算”,系统应该检索正确版本的人事制度并给出有依据的回答。

知识库没有相关规则时,应能说明缺少依据,而不是自行编造。

性能侧还要关注响应延迟、并发能力和Token成本。

面试题③:AI Agent测试和传统自动化测试区别在哪里?
参考回答:

传统自动化由脚本规定执行路径,Agent则能够结合任务目标、当前页面状态和工具反馈决定下一步操作。

它可以动态处理页面变化,但也增加了工具误选、重复操作和执行路径偏离等不确定性。

工程上建议用Agent探索复杂场景,同时保留执行轨迹与业务断言;流程成熟后,再把稳定路径沉淀为可复用的自动化脚本。

面试题④:Agent说“执行成功”,就代表真的成功了吗?
参考回答:

不一定。

比如视频投稿Agent已成功提交,却因为没有识别到结果提示又点了一次“发布”,可能产生重复操作。

评测需要同时看任务结果和过程:

最终业务状态是否正确。
关键业务断言是否通过。
工具调用是否存在重复或无效操作。
执行耗时与Token消耗是否合理。
是否出现越权和重复提交等风险。
对于会修改业务数据的动作,还要检查幂等性和失败恢复。

面试题⑤:MCP与Function Calling有什么区别?
参考回答:

Function Calling主要解决模型如何用结构化参数选择并调用函数;MCP提供标准化的工具与资源连接方式,使AI应用能接入外部系统。

两者不是简单替代关系。

例如可以用MCP Server封装Playwright浏览器操作、HTTP接口调用、测试数据查询等能力。

测试时检查工具发现、参数Schema、调用权限、超时、错误返回和重复调用带来的副作用。

面试题⑥:Playwright自动化脚本不稳定,怎么排查?
参考回答:

先区分是真实业务缺陷、环境波动,还是定位器与等待策略问题。

优先使用getByRole、getByLabel、getByTestId等稳定定位方式,利用自动等待和可重试断言,避免大量固定Sleep。

结合Trace、截图、网络日志分析失败;用例间保持数据隔离。

如果由AI修复脚本,必须复核原有断言是否被保留,不能为了让用例通过就删掉关键校验。

面试题⑦:如何测试AI字幕与视频摘要?
参考回答:

以视频平台场景为例,AI字幕主要检查识别准确率、专业术语、时间轴同步、多语言和噪声环境。

视频摘要重点检查信息覆盖、事实忠实度和重要内容遗漏。

此外还要覆盖无声视频、多人同时说话、异常格式、长视频和并发处理等场景。

模型效果可以采用标注评测集与人工抽检结合的方式,不能只用“接口返回200”判断功能通过。

面试题⑧:AI测试怎样接入CI/CD流水线?
参考回答:

代码提交阶段执行单元测试、静态检查、接口自动化,并由AI辅助补充候选用例。

集成测试阶段运行Web、App和接口回归。

发布前针对AI应用执行RAG、Agent、性能与安全评测。

对于关键任务成功率、响应延迟等具备稳定阈值的指标,可以设置质量门禁。

同时保存模型版本、Prompt版本、评测集版本、执行轨迹和失败记录,方便追踪新旧版本之间的质量变化。

五、AI测试开发工程师的能力准备路线
面试题看似分散,实际可以归纳为一条清晰的学习路线:

先有工程与自动化基础,再补大模型应用、RAG与Agent测试,最后解决如何接入真实研发流程的问题。

能力方向
重点技术
工程基础
Python / Java、SQL、Linux、Git
自动化测试
Pytest、Playwright、Appium、接口自动化
大模型应用
Prompt、Function Calling、结构化输出
RAG与Agent评测
Embedding、Rerank、Trajectory、任务成功率
工程化落地
MCP、CI/CD、可观测性、质量门禁
准备项目介绍时,建议按“业务问题—技术方案—测试方法—评测指标—实际效果”的顺序展开。

比如讲AI驱动的Web测试平台,不仅要说用了哪些模型和工具,还要解释页面状态怎样获取、动作怎样执行、断言怎样验证,失败后如何定位。

能清楚说明技术决策与评测结果,比单纯背诵Agent、RAG、MCP的定义更容易体现工程能力。

六、写在最后
从公开报薪记录看,B站2-1、2-2技术研发岗位分别有48万元和55.5万元的年薪样本。

职级和年包值得参考,但实际选择岗位时,还要结合职责、薪酬构成及团队发展方向。

对测试开发工程师来说,编程、接口自动化和工程化能力依然是底座;RAG评测、Agent测试、MCP工具集成正在扩展测试工作的技术边界。

既能做稳定的自动化,又能验证AI系统真正完成任务,是值得持续积累的能力。

本文部分内容参考了霍格沃兹测试开发学社整理的相关技术资料,主要涉及软件测试、自动化测试、测试开发及 AI 测试等内容,侧重测试实践、工具应用与工程经验整理。

相关文章
|
23小时前
|
人工智能 数据可视化 测试技术
测试工程师必备:代码一键生成业务流程图Skill
日常做测试,遇到复杂业务时,我很依赖后端提供的业务设计流程图。 有了流程图,我可以快速吃透内部实现逻辑,更有针对性地设计测试用例,甚至在前期就能识别出流程隐患,推动开发提前修复,避免问题流入测试阶段打乱整体迭代节奏。 但在 AI 普及之前,流程图需要开发手动绘制,耗时成本高,很多时候很难拿到完整的文档。 现在借助 AI,直接基于源码生成业务逻辑图就变得简单很多。 基于这个真实工作场景,我封装了一款 Skill,可以读取项目代码,快速输出模块与业务流程图。 测试同学如果拥有代码权限,可以直接自行生成;没有权限的话,也可以把这个 Skill 交给开发同事协助产出。 基于代码生成流程图,对测试有哪些
22 0
|
1天前
|
人工智能 安全 测试技术
如果让你测试一个会操作专业软件的Agent,你会从哪一步开始?
本文基于OpenAI与Ironclad的合同工作流研究,提出Computer Use Agent的生产级验收方法:以业务状态为起点,严控权限、路径、副作用与证据链,并将关键约束编入持续回归。强调“做对”比“做完”更重要。
|
2天前
|
数据采集 人工智能 测试技术
测试报告也能自动写?用 Agent Skills 搞定质量周报
本文介绍如何用三个AI Agent Skill自动化质量周报:①数据聚合(统一拉取JIRA/CI/覆盖率/Git等多源数据);②趋势分析(对比历史,识别Bug激增、覆盖率骤降等风险);③报告生成(输出结构化Markdown周报)。全流程耗时从2小时压缩至20分钟,释放测试人员精力聚焦分析与决策。
|
11天前
|
人工智能 JSON 架构师
AI+Swagger:一键生成500条pytest接口用例
本文分享AI驱动接口测试的实战经验:87个接口,手工测试需3天,AI+Clean Swagger仅3小时完成529条pytest用例。核心不在模型多强,而在Swagger是否规范(OpenAPI 3.0、operationId唯一、字段示例/枚举/校验完备)。AI负责智能补全测试场景,人专注审核断言与业务逻辑,实现高效、可持续的自动化回归。
|
12天前
|
人工智能 安全 API
不用先学复杂平台:6个步骤把Agent的工具调用、轨迹和结果测清楚
本文揭示Agent测试的核心陷阱:答案正确≠行为可靠。AWS Agent-EvalKit提出Plan-Data-Trace-Run-Eval-Report六阶段评测法,强调通过完整执行轨迹验证工具调用、参数准确、数据忠实与推理连贯性,而非仅检验最终输出。适合测试团队快速落地实践。
|
1天前
|
人工智能 监控 测试技术
AI Coding 质量治理:工程规范、代码评审与风险驱动测试
本文基于31万行AI重构实践,提出AI Coding质量保障五维方法:统一AI Rule与Skill规范开发、AI辅助技术债分析、AI Code Review前置预审、风险驱动而非用例驱动的测试、渐进式重构治理技术债,强调工程标准、人工判断与自动化验证协同。
|
12天前
|
jenkins 测试技术 持续交付
简历写了「会用 Jenkins 跑自动化」,被问流水线分几层就卡住:新人该补的是骨架不是按钮
本文揭秘CI流水线的5层骨架:触发(何时跑)、准备(环境就绪)、执行(测试顺序)、结果(报告归档)、门禁与反馈(质量拦截)。聚焦新人最易踩坑的准备层与结果层,结合GitHub Actions实操案例,帮你从“会点按钮”跃升为“懂系统逻辑”,精准击中面试考察核心。
|
19小时前
|
人工智能 缓存 测试技术
AI总能把代码写出来,为什么一接公司接口就开始“凭经验乱猜”?
本文基于微软“Agent Experience(AX)”理念,剖析Coding Agent调用过期SDK、误选接口、假成功等根因,提出面向AI代理的API质量验收框架:聚焦文档可发现性、可执行样例、竞争性回归测试,覆盖发现—选择—执行—恢复全链路,推动API从“人可用”迈向“Agent可信”。
|
1天前
|
人工智能 安全 测试技术
一次服务重构的完整复盘:从2天人工梳理到40分钟AI链路分析,我做了什么
去年Q4,我们重构运行6年的C++交易核心服务。通过拆解为“调用链追踪→逐层理解→Proto比对→方案生成”四步标准化流程,结合AI辅助+人工决策,链路分析从2-3天缩至40分钟,P99延迟由180ms降至45ms,零回滚。关键经验:重方案轻编码、AI防遗漏、沉淀可复用Skill。
|
6天前
|
人工智能 JSON 测试技术
接口用例越多越难维护?先让AI学会看懂一次业务变更
本文揭示AI测试维护的核心陷阱:字段微调易引发业务逻辑误判。主张以“判影响”替代“改脚本”,依托OpenAPI与业务不变量生成候选影响清单,聚焦高风险链路验证,并将关键断言(如状态约束、金额守恒)纳入契约回归,实现可追溯、可复用的质量门禁。

热门文章

最新文章