哔哩哔哩(Bilibili,简称B站)的业务覆盖视频、直播、游戏、广告、会员等领域。对于考虑进入B站的技术人员,最先想了解的往往是三件事:职级怎么分、年薪大概多少、面试需要准备什么。
先看B站职级、年薪和绩效机制,再进入AI测试开发技术面试题。
一、B站职级体系与公开薪酬水平
在公开薪酬记录中,可以看到1、2-1、2-2、3-1、3-2、3-3、4-1等职级编号。
这些编号出现在技术研发、产品经理、运营等岗位中,具体职责还要结合岗位序列判断。
- B站不同职级年薪多少?
职级
岗位
年薪
2-1
技术研发
48万元
2-2
技术研发
55.5万元
3-1
运营
61万元
4-1
产品经理
257.5万元
这四条公开报薪记录的工作地点均为上海。
2-1与2-2属于技术研发岗位,年薪分别为48万元和55.5万元;3-1为运营岗位,年薪61万元;4-1为产品经理岗位,年薪257.5万元。
职级只是了解岗位的一个入口。技术研发岗更值得关心的,是实际负责哪些系统、项目难度有多大,以及年包的构成。
- 相邻职级的样本差额
2-1与2-2两条技术研发记录相差7.5万元,差幅约15.6%。
从2-2技术研发到3-1运营记录,相差5.5万元,约9.9%。
这两组差额对应的是不同人的收入记录,其中3-1还是运营岗,因此15.6%和9.9%都不能直接理解为晋升涨薪比例。
对测试开发、后端研发等求职者来说,同样的职级编号下,岗位是偏业务交付、专项质量保障,还是平台工程建设,通常会影响实际的职责要求和薪酬谈判。
二、B站薪酬结构:年包不只是月薪
B站公开的ESG报告介绍了“以能定级、以级定薪、以功定绩、以绩定奖”的薪酬管理原则。
看到年包数字时,可以先把它拆成几部分。
薪酬项目
谈Offer时重点确认
固定月薪
税前金额、固定发薪月数
绩效/年终奖
目标金额、考核方式、发放时间
股权激励
授予形式、归属周期、兑现条件
其他福利
补贴、保险、休假等具体政策
举个例子,两份Offer都写着年包50万元,一份固定现金占比较高,另一份则包含较多绩效奖金或股权。数字一样,收入的稳定性却可能不同。
拿到Offer后,先确认保底现金,再看绩效奖金如何兑现,最后核对长期激励。
这样比单纯比较“多少万年包”更容易判断两份机会的差别。
三、B站绩效考核与员工发展
B站公开的ESG报告显示,公司将360度绩效评估扩展至全体员工,并继续使用OKR促进目标对齐与协作。
公开披露的绩效流程包括:
① 员工自评
② 360度反馈
③ 主管评价与上级校准
④ 结果沟通
⑤ 绩效申诉
图片
落到技术岗位,绩效讨论通常离不开工作交付、复杂问题解决、协作推动等具体成果。
例如,是否按期完成关键需求,能否解决影响线上稳定性的技术问题,或者是否通过测试平台、自动化流程减少了重复工作。
求职时可以进一步问清楚:团队主要负责哪些系统?试用期和年度目标是什么?怎样评价一个测试开发工程师的工作成果?
这些问题有助于判断岗位是否适合自己。
四、AI测试开发面试题:从概念走向工程实践
结合霍格沃兹测试开发学社学员的面试交流,我们把常见的技术考察方向归纳为8道题,重点放在大模型应用、RAG评测、Agent执行、工具集成与自动化工程。
面试题①:AI生成测试用例,怎样评估生成质量?
参考回答:
首先看需求覆盖率,其次检查用例准确性、重复率和可执行性。
比如登录功能,除了正确账号密码,还要覆盖账户锁定、验证码过期、接口超时和异常权限。
实际落地时,可以建立“需求—测试点—测试用例”的映射关系,先用人工审核的标准用例集作为基线,再计算覆盖情况;对支付、权限等高风险场景保留人工复核。
面试题②:RAG知识库应该怎么测试?
参考回答:
RAG要分开测检索和生成。
文档解析阶段检查正文、表格与元数据是否丢失;检索阶段关注Recall@K、Precision@K及相关文档排序;生成阶段检查答案准确性、事实依据和引用是否正确。
例如用户问“年假怎样计算”,系统应该检索正确版本的人事制度并给出有依据的回答。
知识库没有相关规则时,应能说明缺少依据,而不是自行编造。
性能侧还要关注响应延迟、并发能力和Token成本。
面试题③:AI Agent测试和传统自动化测试区别在哪里?
参考回答:
传统自动化由脚本规定执行路径,Agent则能够结合任务目标、当前页面状态和工具反馈决定下一步操作。
它可以动态处理页面变化,但也增加了工具误选、重复操作和执行路径偏离等不确定性。
工程上建议用Agent探索复杂场景,同时保留执行轨迹与业务断言;流程成熟后,再把稳定路径沉淀为可复用的自动化脚本。
面试题④:Agent说“执行成功”,就代表真的成功了吗?
参考回答:
不一定。
比如视频投稿Agent已成功提交,却因为没有识别到结果提示又点了一次“发布”,可能产生重复操作。
评测需要同时看任务结果和过程:
最终业务状态是否正确。
关键业务断言是否通过。
工具调用是否存在重复或无效操作。
执行耗时与Token消耗是否合理。
是否出现越权和重复提交等风险。
对于会修改业务数据的动作,还要检查幂等性和失败恢复。
面试题⑤:MCP与Function Calling有什么区别?
参考回答:
Function Calling主要解决模型如何用结构化参数选择并调用函数;MCP提供标准化的工具与资源连接方式,使AI应用能接入外部系统。
两者不是简单替代关系。
例如可以用MCP Server封装Playwright浏览器操作、HTTP接口调用、测试数据查询等能力。
测试时检查工具发现、参数Schema、调用权限、超时、错误返回和重复调用带来的副作用。
面试题⑥:Playwright自动化脚本不稳定,怎么排查?
参考回答:
先区分是真实业务缺陷、环境波动,还是定位器与等待策略问题。
优先使用getByRole、getByLabel、getByTestId等稳定定位方式,利用自动等待和可重试断言,避免大量固定Sleep。
结合Trace、截图、网络日志分析失败;用例间保持数据隔离。
如果由AI修复脚本,必须复核原有断言是否被保留,不能为了让用例通过就删掉关键校验。
面试题⑦:如何测试AI字幕与视频摘要?
参考回答:
以视频平台场景为例,AI字幕主要检查识别准确率、专业术语、时间轴同步、多语言和噪声环境。
视频摘要重点检查信息覆盖、事实忠实度和重要内容遗漏。
此外还要覆盖无声视频、多人同时说话、异常格式、长视频和并发处理等场景。
模型效果可以采用标注评测集与人工抽检结合的方式,不能只用“接口返回200”判断功能通过。
面试题⑧:AI测试怎样接入CI/CD流水线?
参考回答:
代码提交阶段执行单元测试、静态检查、接口自动化,并由AI辅助补充候选用例。
集成测试阶段运行Web、App和接口回归。
发布前针对AI应用执行RAG、Agent、性能与安全评测。
对于关键任务成功率、响应延迟等具备稳定阈值的指标,可以设置质量门禁。
同时保存模型版本、Prompt版本、评测集版本、执行轨迹和失败记录,方便追踪新旧版本之间的质量变化。
五、AI测试开发工程师的能力准备路线
面试题看似分散,实际可以归纳为一条清晰的学习路线:
先有工程与自动化基础,再补大模型应用、RAG与Agent测试,最后解决如何接入真实研发流程的问题。
能力方向
重点技术
工程基础
Python / Java、SQL、Linux、Git
自动化测试
Pytest、Playwright、Appium、接口自动化
大模型应用
Prompt、Function Calling、结构化输出
RAG与Agent评测
Embedding、Rerank、Trajectory、任务成功率
工程化落地
MCP、CI/CD、可观测性、质量门禁
准备项目介绍时,建议按“业务问题—技术方案—测试方法—评测指标—实际效果”的顺序展开。
比如讲AI驱动的Web测试平台,不仅要说用了哪些模型和工具,还要解释页面状态怎样获取、动作怎样执行、断言怎样验证,失败后如何定位。
能清楚说明技术决策与评测结果,比单纯背诵Agent、RAG、MCP的定义更容易体现工程能力。
六、写在最后
从公开报薪记录看,B站2-1、2-2技术研发岗位分别有48万元和55.5万元的年薪样本。
职级和年包值得参考,但实际选择岗位时,还要结合职责、薪酬构成及团队发展方向。
对测试开发工程师来说,编程、接口自动化和工程化能力依然是底座;RAG评测、Agent测试、MCP工具集成正在扩展测试工作的技术边界。
既能做稳定的自动化,又能验证AI系统真正完成任务,是值得持续积累的能力。
本文部分内容参考了霍格沃兹测试开发学社整理的相关技术资料,主要涉及软件测试、自动化测试、测试开发及 AI 测试等内容,侧重测试实践、工具应用与工程经验整理。