百度 文心一言 Agent 实习面经

正文

  1. 项目+实习 55min
  2. 论文Reward Design 的构造
  3. Traning Agent构造数据的pipeline
  4. PPO 和GRPO 区别
  5. 手撕:三数之和

面完半小时光速OC #互联网大厂实习 #面经 #百度 #文心一言 #Agent

#互联网大厂实习 #面经 #百度 #文心一言 #Agent #作者

长图内容(视觉重读)

图 p01 / p02:面经文字卡片与封面,内容与正文一致,无额外信息

图 p04 / p05 / p06:表情包贴纸,无面经内容

图片

p01.webp
p01.webp
p02.webp
p02.webp
p04.png
p04.png
p05.png
p05.png
p06.png
p06.png

评论摘录

  • Whisky:总共几面呀
  • CANny (等待入职版)(作者):就一面 半个小时后 hr 说直接通过了
  • something:大佬您研几啊,一般paper你们怎么推进的哇。我目前研一很焦虑paper的事情又担心到时候工作的事情。如果有想法可以和我说一下嘛?打扰了
  • CANny (等待入职版)(作者):我们实验室基本是研一就幸苦一点,边上课边把paper发出去了,后面就出去实习了
  • 1213:是不是TRPO打成GRPO了呀
  • 每天都想躺但迟迟没躺的🐃🐴:佬是秋招提前批吗?
  • 醉翁亭记:他标题写的实习
  • solight:好奇这个咋问的Traning Agent构造数据的pipeline
  • CANny (等待入职版)(作者):这里我们做的一个search agent ,并且构建一个benchmark 所以自己要先有一个rollout数据作为training 的GT
  • 烂🍊同学:太强了佬

我的批注

  • 是否对标上海实习主线(Agent 应用/全栈)
  • 可迁移到简历/项目的点:
  • 待补学:

Liked this note? Share it on Twitter / X, or browse more writing from the home page. Feedback and pointers welcome via @qianyuhe.

Thanks for reading.

– 千羽鹤