面经.大模型算法三年以内#

大模型算法工程师.面试

一面第一场

  • 问句召回效果怎么对比的?
  • 抽取知识图谱使用专业模型和直接使用大模型提示 schema 效果有测量对比过吗? 讲求数据决策
  • 知识图谱消歧是怎么做的? 为什么不从问句入手。
  • 路由跳转和维护存档
  • 场景很固定的话为什么不使用skills,开销可以接受
  • 项目出于什么业务场景

一面第二场

  1. 扫描的用OCR,标准版的更多是文本类用规则方法解析,效能更好,图片不做要求吗
  2. 检索用的是多路召回
  3. AgenticRAG 和普通的 RAG 有什么不同,可以用 mysql 查询工具
  4. MCP 封装,skills 封装的使用案例
  5. 为什么选择使用 chromaDB 数据库,技术选型的理由?部署落地的便利程度,集合分离。
  6. 交互型项目有项目指标吗?
  7. 增加业务后怎么拓展系统功能?改指令还是改架构模块呢,也就是全部改还是部分改?
  8. 记忆总结文档的使用方式,作为指令注入还是人为调用补充。

一面第三场

  1. 场景总共全部数据表有多少张? 这个业务的架构是什么? 无敌的内外网开发.
  2. 表的质量内容和日常口语化表达对齐? 生成 SQL 需要从问题触发, 如何把口语化表达对齐规范的表述? 那么跨表或者是比较复杂的查询怎么保证准确率? RS 双模型校验功能. 有测试多表联查召回的准确率. 项目性质是交付项目吗? 还是有指标?测试的方式是相同案例是产生相同反馈, 也就是多轮一致性.
  3. 检索是怎么实现的? pvector 向量长度怎么选? 用什么向量模型 ( embedding ) 然后自行详细说明检索过程. TOP128 然后 RRF 融合排序成前 64 rerankk TOP16 (经过测试吗? 因为涉及多个法规, 满足要求之后再降低精度, 这里有端到端召回准确率正确率的指标测试) 返回大模型, 然后给大模型判定, 如果不能实现的话定点搜索确实的信息.
  4. 测试的完整流程是什么? 有比较多审查项然后对审查项打分.
  5. 系统集成功能越来越多之后怎么设计, 如果系统更多, 兼容其他模块怎么优化呢? 解决方案 harness 工程分块, 写成不同的功能模块然后路由自行选择. 26年2月没有 skills. 调用工具编排适合做出 skills 形式吗? 工具就 MCP 比较好.
  6. skills 会污染 prompt 的呢. ToB 场景感觉比较适合整理成 skills.
  7. LangGraph 和 Dify 对于固定流程非常方便, 相对比较死板.
  8. 取证怎么取? 数据表吗?
  9. 怎么评价 harness 工程的效果? 需要 agent RL benchmark. 比如调用工具的准确率, 模型端到端的任务解决能力, 少工具调用和高解决效果. SWE bench
  10. FAE
  11. 遗传算法多因子虚拟币, 比较邪门歪道.
  12. 本体论那一套的图平台.

一面第四场

  1. 用 LangGraph 什么特性解决问题, 可不可以不使用 LangGraph? (状态, 节点, 边是流程执行, checkpoint 快照机制允许回退和断点使用和人工介入机制, 这两个是 LangChain 没有) 所以核心来讲是意图识别, 编排规划和 checkpoint
  2. checkpoint 恢复的机制是怎么样的? 也就是中断(例如服务器宕机). 具体来说副作用补偿机制, 比如说不能在有问题的节点开始恢复(否则就会一直失败), 从成功节点开始恢复.
  3. 向量数据库架构设计为什么分门别类呢? neo4j 一定要结构化严格验证. 口语化只需要知识库匹配. 主要是权重不一样. 主流的 RAG 方案结构化向量语义和模块化的图形语义, 会选择一个方案解决两种问题吗?
  4. RRF 和 reranked 解决什么问题? 提高召回率. Hybrid Retrival. 用文本块排名能缓解分数带来的权重不平衡, reranked 语义不平衡.
  5. RAG 是检索文本, agent 是基于自然语言调用工具. 做 PDF 的跨页表格怎么处理, 处理的效果怎么样? MinerU 版面分析和表格定位. 跨页表格判断页之间有序表关键词提醒, 以及表头相同检索. 关键字整理. 问题在于中断数据失去字段语义, 可以转换成 html, 保留 th, tr 可以识别表格标识符.
  6. 如果让你设计一个企业级 agent, 类似于 harness 工程的概念, 包含权限管理, 安全维护, 包含 agent, RAG, 上下文管理. 讲你的框架, 系统结构, 和每部分你会安排做什么事情. 工具调用必须设计权限观察.

AI提供的提问增强

  • 在实现多路检索并行架构时,你遇到的最大性能瓶颈是什么?如何解决的?”
  • 断崖检测动态截断策略中的‘断崖’具体是如何定义的?阈值是多少?为什么选这个值?”
  • LangGraph的工作流中,状态图是如何设计的?如何处理循环和错误?”
  • “在微调 Qwen2.5-14B 时,你使用了什么数据集?LoRA的秩(rank)和alpha值是多少?为什么这样设置?”
  • 商品名智能确认机制中的‘三级过滤’具体指哪三级?每级的准确率和召回率大概是多少?”