2026年哔哩哔哩职级与薪资体系,附AI测试开发面试题

简介: 本文详解B站职级体系、薪酬结构(含年包构成与绩效机制)及AI测试开发面试核心题(RAG评测、Agent测试、MCP集成等),覆盖从求职定位到工程落地的全链路准备,助力技术人员精准评估机会、高效备战面试。

哔哩哔哩(Bilibili,简称B站)的业务覆盖视频、直播、游戏、广告、会员等领域。对于考虑进入B站的技术人员,最先想了解的往往是三件事:职级怎么分、年薪大概多少、面试需要准备什么。

先看B站职级、年薪和绩效机制,再进入AI测试开发技术面试题。

一、B站职级体系与公开薪酬水平
在公开薪酬记录中,可以看到1、2-1、2-2、3-1、3-2、3-3、4-1等职级编号。

这些编号出现在技术研发、产品经理、运营等岗位中,具体职责还要结合岗位序列判断。

  1. B站不同职级年薪多少?
    职级
    岗位
    年薪
    2-1
    技术研发
    48万元
    2-2
    技术研发
    55.5万元
    3-1
    运营
    61万元
    4-1
    产品经理
    257.5万元
    这四条公开报薪记录的工作地点均为上海。

2-1与2-2属于技术研发岗位,年薪分别为48万元和55.5万元;3-1为运营岗位,年薪61万元;4-1为产品经理岗位,年薪257.5万元。

职级只是了解岗位的一个入口。技术研发岗更值得关心的,是实际负责哪些系统、项目难度有多大,以及年包的构成。

  1. 相邻职级的样本差额
    2-1与2-2两条技术研发记录相差7.5万元,差幅约15.6%。

从2-2技术研发到3-1运营记录,相差5.5万元,约9.9%。

这两组差额对应的是不同人的收入记录,其中3-1还是运营岗,因此15.6%和9.9%都不能直接理解为晋升涨薪比例。

对测试开发、后端研发等求职者来说,同样的职级编号下,岗位是偏业务交付、专项质量保障,还是平台工程建设,通常会影响实际的职责要求和薪酬谈判。

二、B站薪酬结构:年包不只是月薪
B站公开的ESG报告介绍了“以能定级、以级定薪、以功定绩、以绩定奖”的薪酬管理原则。

看到年包数字时,可以先把它拆成几部分。

薪酬项目
谈Offer时重点确认
固定月薪
税前金额、固定发薪月数
绩效/年终奖
目标金额、考核方式、发放时间
股权激励
授予形式、归属周期、兑现条件
其他福利
补贴、保险、休假等具体政策
举个例子,两份Offer都写着年包50万元,一份固定现金占比较高,另一份则包含较多绩效奖金或股权。数字一样,收入的稳定性却可能不同。

拿到Offer后,先确认保底现金,再看绩效奖金如何兑现,最后核对长期激励。

这样比单纯比较“多少万年包”更容易判断两份机会的差别。

三、B站绩效考核与员工发展
B站公开的ESG报告显示,公司将360度绩效评估扩展至全体员工,并继续使用OKR促进目标对齐与协作。

公开披露的绩效流程包括:

① 员工自评

② 360度反馈

③ 主管评价与上级校准

④ 结果沟通

⑤ 绩效申诉

图片

落到技术岗位,绩效讨论通常离不开工作交付、复杂问题解决、协作推动等具体成果。

例如,是否按期完成关键需求,能否解决影响线上稳定性的技术问题,或者是否通过测试平台、自动化流程减少了重复工作。

求职时可以进一步问清楚:团队主要负责哪些系统?试用期和年度目标是什么?怎样评价一个测试开发工程师的工作成果?

这些问题有助于判断岗位是否适合自己。

四、AI测试开发面试题:从概念走向工程实践
结合霍格沃兹测试开发学社学员的面试交流,我们把常见的技术考察方向归纳为8道题,重点放在大模型应用、RAG评测、Agent执行、工具集成与自动化工程。

面试题①:AI生成测试用例,怎样评估生成质量?
参考回答:

首先看需求覆盖率,其次检查用例准确性、重复率和可执行性。

比如登录功能,除了正确账号密码,还要覆盖账户锁定、验证码过期、接口超时和异常权限。

实际落地时,可以建立“需求—测试点—测试用例”的映射关系,先用人工审核的标准用例集作为基线,再计算覆盖情况;对支付、权限等高风险场景保留人工复核。

面试题②:RAG知识库应该怎么测试?
参考回答:

RAG要分开测检索和生成。

文档解析阶段检查正文、表格与元数据是否丢失;检索阶段关注Recall@K、Precision@K及相关文档排序;生成阶段检查答案准确性、事实依据和引用是否正确。

例如用户问“年假怎样计算”,系统应该检索正确版本的人事制度并给出有依据的回答。

知识库没有相关规则时,应能说明缺少依据,而不是自行编造。

性能侧还要关注响应延迟、并发能力和Token成本。

面试题③:AI Agent测试和传统自动化测试区别在哪里?
参考回答:

传统自动化由脚本规定执行路径,Agent则能够结合任务目标、当前页面状态和工具反馈决定下一步操作。

它可以动态处理页面变化,但也增加了工具误选、重复操作和执行路径偏离等不确定性。

工程上建议用Agent探索复杂场景,同时保留执行轨迹与业务断言;流程成熟后,再把稳定路径沉淀为可复用的自动化脚本。

面试题④:Agent说“执行成功”,就代表真的成功了吗?
参考回答:

不一定。

比如视频投稿Agent已成功提交,却因为没有识别到结果提示又点了一次“发布”,可能产生重复操作。

评测需要同时看任务结果和过程:

最终业务状态是否正确。
关键业务断言是否通过。
工具调用是否存在重复或无效操作。
执行耗时与Token消耗是否合理。
是否出现越权和重复提交等风险。
对于会修改业务数据的动作,还要检查幂等性和失败恢复。

面试题⑤:MCP与Function Calling有什么区别?
参考回答:

Function Calling主要解决模型如何用结构化参数选择并调用函数;MCP提供标准化的工具与资源连接方式,使AI应用能接入外部系统。

两者不是简单替代关系。

例如可以用MCP Server封装Playwright浏览器操作、HTTP接口调用、测试数据查询等能力。

测试时检查工具发现、参数Schema、调用权限、超时、错误返回和重复调用带来的副作用。

面试题⑥:Playwright自动化脚本不稳定,怎么排查?
参考回答:

先区分是真实业务缺陷、环境波动,还是定位器与等待策略问题。

优先使用getByRole、getByLabel、getByTestId等稳定定位方式,利用自动等待和可重试断言,避免大量固定Sleep。

结合Trace、截图、网络日志分析失败;用例间保持数据隔离。

如果由AI修复脚本,必须复核原有断言是否被保留,不能为了让用例通过就删掉关键校验。

面试题⑦:如何测试AI字幕与视频摘要?
参考回答:

以视频平台场景为例,AI字幕主要检查识别准确率、专业术语、时间轴同步、多语言和噪声环境。

视频摘要重点检查信息覆盖、事实忠实度和重要内容遗漏。

此外还要覆盖无声视频、多人同时说话、异常格式、长视频和并发处理等场景。

模型效果可以采用标注评测集与人工抽检结合的方式,不能只用“接口返回200”判断功能通过。

面试题⑧:AI测试怎样接入CI/CD流水线?
参考回答:

代码提交阶段执行单元测试、静态检查、接口自动化,并由AI辅助补充候选用例。

集成测试阶段运行Web、App和接口回归。

发布前针对AI应用执行RAG、Agent、性能与安全评测。

对于关键任务成功率、响应延迟等具备稳定阈值的指标,可以设置质量门禁。

同时保存模型版本、Prompt版本、评测集版本、执行轨迹和失败记录,方便追踪新旧版本之间的质量变化。

五、AI测试开发工程师的能力准备路线
面试题看似分散,实际可以归纳为一条清晰的学习路线:

先有工程与自动化基础,再补大模型应用、RAG与Agent测试,最后解决如何接入真实研发流程的问题。

能力方向
重点技术
工程基础
Python / Java、SQL、Linux、Git
自动化测试
Pytest、Playwright、Appium、接口自动化
大模型应用
Prompt、Function Calling、结构化输出
RAG与Agent评测
Embedding、Rerank、Trajectory、任务成功率
工程化落地
MCP、CI/CD、可观测性、质量门禁
准备项目介绍时,建议按“业务问题—技术方案—测试方法—评测指标—实际效果”的顺序展开。

比如讲AI驱动的Web测试平台,不仅要说用了哪些模型和工具,还要解释页面状态怎样获取、动作怎样执行、断言怎样验证,失败后如何定位。

能清楚说明技术决策与评测结果,比单纯背诵Agent、RAG、MCP的定义更容易体现工程能力。

六、写在最后
从公开报薪记录看,B站2-1、2-2技术研发岗位分别有48万元和55.5万元的年薪样本。

职级和年包值得参考,但实际选择岗位时,还要结合职责、薪酬构成及团队发展方向。

对测试开发工程师来说,编程、接口自动化和工程化能力依然是底座;RAG评测、Agent测试、MCP工具集成正在扩展测试工作的技术边界。

既能做稳定的自动化,又能验证AI系统真正完成任务,是值得持续积累的能力。

本文部分内容参考了霍格沃兹测试开发学社整理的相关技术资料,主要涉及软件测试、自动化测试、测试开发及 AI 测试等内容,侧重测试实践、工具应用与工程经验整理。

相关文章
|
19天前
|
人工智能 JSON API
全网刷屏的 Jev 模型正式开放!一手实战测评 + 保姆级教程
全网爆火的 Jev 模型是什么?有什么用?怎么使用?怎么接入 AI 编程工具?效果真的好么?傻子可懂的 Jev 保姆级实战教程 + 项目实战测评来啦
8783 25
|
17天前
|
人工智能 并行计算 PyTorch
秋叶 ComfyUI 2026 整合包 v3.2 完整部署教程:Python 3.13 + Torch 2.13 全栈升级
秋叶aaaki ComfyUI 2026年8月整合包v3.2正式发布!全面升级Python 3.13.11、PyTorch 2.13.0+cu130及ComfyUI v0.30.2,原生支持MiniMax H3、Wan 2.2、Qwen-Image-2.1等2026主流音视频/图像模型,解压即用,无需环境配置。
3344 15
|
17天前
|
人工智能 测试技术 API
最近全网爆火的 Jev 到底是什么?适合干什么、怎么用,一篇讲透!
Jev是TypeSafe AI推出的“系统一模型”,不生成文本,专做毫秒级结构化决策:Choice(多选)、Score(打分)、Noul(是非概率)。响应快193倍、成本低444倍,适合工单路由、内容审核、测试定级等高频判断场景。
2194 4
最近全网爆火的 Jev 到底是什么?适合干什么、怎么用,一篇讲透!
|
11天前
|
人工智能 Linux 开发者
【2026国内使用】Codex安装过程一篇讲透(Win/Mac/Linux全支持)
Codex是OpenAI推出的AI编程智能体,可读取本地项目、理解需求并自动修改代码。支持桌面GUI、命令行(CLI)及VS Code/Cursor插件三种形态,覆盖可视化操作、终端高效开发与编辑器无缝集成场景,助开发者用自然语言驱动编码全流程。(239字)
【2026国内使用】Codex安装过程一篇讲透(Win/Mac/Linux全支持)
|
17天前
|
云安全 人工智能 安全
|
3天前
|
人工智能 JSON 自然语言处理
2026 年 Jev 决策模型深度拆解:原理解读、实战测评与保姆级落地教程
有一款特殊AI模型在开发者圈子刷屏,它摒弃传统大模型擅长的对话聊天能力,专注做高速结构化决策,它就是TypeSafe AI推出的Jev模型。该模型由ChatGPT共同发明人Diogo Almeida主导研发,定位为**System One Model(系统一模型)**,对标人类大脑快速直觉判断的思维模式,在响应延迟、调用成本、结构化输出稳定性上相比传统生成式大模型有着巨大差异。本文会完整拆解Jev底层原理、三大核心原语能力、适用业务场景,同时提供可直接运行的curl、Python代码示例,并且结合多组实测数据,客观分析模型优势与能力边界,帮助普通开发者和AI应用从业者快速上手落地。
363 1
|
6天前
|
人工智能 Linux Windows
千问办公(QwenWork)官网入口:其实有2个,一个是网页端千问办公,一个是介绍指南页面
千问办公(QwenWork)是阿里云推出的AI智能办公平台,支持网页端直接使用及Windows/Mac/Linux客户端下载。提供PPT生成、财报分析、网页搭建等AI功能,个人版免费,企业版198元/席/月。详情见官网qwenwork.cn或阿里云产品页。
803 0
千问办公(QwenWork)官网入口:其实有2个,一个是网页端千问办公,一个是介绍指南页面

热门文章

最新文章