字节大模型Agent 算法一面

正文

请介绍 Transformer 的结构组成及各部分作用。

如何降低 Transformer 的计算复杂度?常见的稀疏注意力变体有哪些?

LoRA 微调的原理是什么?秩 r 的选择会对模型表现产生什么影响?

KV Cache 是什么?为什么能提升推理速度?

RAG 的完整流程是怎样的?

微调时的训练数据是怎么构建的?如何保证样本多样性和质量?

在 RAG + 知识图谱的 Agent 系统中,知识图谱更新机制是怎样的?

在高并发查询的 Agent 系统中,你会如何优化召回和生成阶段的延迟?

训练 LoRA 模型时,你是如何选择冻结层的?依据是什么?

大规模 Agent 系统在多线程场景下,资源调度策略如何设计?

#八股 #校招 #面试技巧 #面试题 #大模型面试 #面经 #大模型 #字节大模型 #春招火热进行中

#八股 #校招 #面试技巧 #面试题 #大模型面试 #面经 #大模型 #字节大模型 #春招火热进行中

长图内容(视觉重读)

岗位信息:岗位名称 大模型 Agent 算法;面试时长 1h;博主自评分 7.5/10;是否下一轮:待通知。

Transformer 与模型基础

  • 请介绍 Transformer 的结构组成及各部分作用。
    • (追问)Self-Attention 和 FFN 分别在模型中承担什么角色?
    • (追问)如果去掉 FFN,会对模型能力产生什么影响?
  • 如何降低 Transformer 的计算复杂度?常见的稀疏注意力变体有哪些?
    • (追问)不同稀疏注意力方案适用场景有啥区别?
    • (追问)在长文本场景中优先选择哪种优化方式?

模型优化与推理加速

  • LoRA 微调的原理是什么?秩 r 的选择会对模型表现产生什么影响?
    • (追问)r 过大或过小分别会带来什么问题?
    • (追问)LoRA 和全量微调在效果和成本上的差异是什么?
  • KV Cache 是什么?为什么能提升推理速度?
    • (追问)KV Cache 在多轮对话中如何复用?
    • (追问)会带来哪些额外的内存开销?

RAG 与数据构建

  • RAG 的完整流程是怎样的?
    • (追问)向量检索库构建时,如何处理时间衰减对召回的影响?
    • (追问)如果召回结果不准确优先优化哪部分?
  • 微调时的训练数据是怎么构建的?如何保证样本多样性和质量?
    • (追问)数据清洗和去重一般怎么做?
    • (追问)如何判断数据是否对模型有正向提升?

Agent 与系统设计

  • 在 RAG + 知识图谱的 Agent 系统中,知识图谱更新机制是怎样的?
    • (追问)如何保证知识更新的实时性?
    • (追问)如果数据存在冲突,你会怎么处理?
  • 在高并发查询的 Agent 系统中,你会如何优化召回和生成阶段的延迟?
    • (追问)召回和生成阶段哪个更容易成为瓶颈?
    • (追问)如何做缓存或分级处理来降低延迟?

训练策略与工程实践

  • 训练 LoRA 模型时,你是如何选择冻结层的?依据是什么?
    • (追问)不同层对任务的影响有什么差异?
    • (追问)有没有做过对比实验来验证?
  • 大规模 Agent 系统在多线程场景下,资源调度策略如何设计?
    • (追问)如何避免资源竞争或死锁问题?
    • (追问)GPU/CPU 混合场景下如何分配任务?

图片

p01.webp
p01.webp
p02.webp
p02.webp
p03.webp
p03.webp
p04.webp
p04.webp

评论摘录

未抓到评论或评论区为空

我的批注

  • 是否对标上海实习主线(Agent 应用/全栈)
  • 可迁移到简历/项目的点:
  • 待补学:

Liked this note? Share it on Twitter / X, or browse more writing from the home page. Feedback and pointers welcome via @qianyuhe.

Thanks for reading.

– 千羽鹤