面经.大模型算法三年以内#
大模型算法工程师.面试
一面第一场
- 问句召回效果怎么对比的?
- 抽取知识图谱使用专业模型和直接使用大模型提示 schema 效果有测量对比过吗? 讲求数据决策
- 知识图谱消歧是怎么做的? 为什么不从问句入手。
- 路由跳转和维护存档
- 场景很固定的话为什么不使用skills,开销可以接受
- 项目出于什么业务场景
一面第二场
- 扫描的用OCR,标准版的更多是文本类用规则方法解析,效能更好,图片不做要求吗
- 检索用的是多路召回
- AgenticRAG 和普通的 RAG 有什么不同,可以用 mysql 查询工具
- MCP 封装,skills 封装的使用案例
- 为什么选择使用 chromaDB 数据库,技术选型的理由?部署落地的便利程度,集合分离。
- 交互型项目有项目指标吗?
- 增加业务后怎么拓展系统功能?改指令还是改架构模块呢,也就是全部改还是部分改?
- 记忆总结文档的使用方式,作为指令注入还是人为调用补充。
一面第三场
- 场景总共全部数据表有多少张? 这个业务的架构是什么? 无敌的内外网开发.
- 表的质量内容和日常口语化表达对齐? 生成 SQL 需要从问题触发, 如何把口语化表达对齐规范的表述? 那么跨表或者是比较复杂的查询怎么保证准确率? RS 双模型校验功能. 有测试多表联查召回的准确率. 项目性质是交付项目吗? 还是有指标?测试的方式是相同案例是产生相同反馈, 也就是多轮一致性.
- 检索是怎么实现的? pvector 向量长度怎么选? 用什么向量模型 ( embedding ) 然后自行详细说明检索过程. TOP128 然后 RRF 融合排序成前 64 rerankk TOP16 (经过测试吗? 因为涉及多个法规, 满足要求之后再降低精度, 这里有端到端召回准确率正确率的指标测试) 返回大模型, 然后给大模型判定, 如果不能实现的话定点搜索确实的信息.
- 测试的完整流程是什么? 有比较多审查项然后对审查项打分.
- 系统集成功能越来越多之后怎么设计, 如果系统更多, 兼容其他模块怎么优化呢? 解决方案 harness 工程分块, 写成不同的功能模块然后路由自行选择. 26年2月没有 skills. 调用工具编排适合做出 skills 形式吗? 工具就 MCP 比较好.
- skills 会污染 prompt 的呢. ToB 场景感觉比较适合整理成 skills.
- LangGraph 和 Dify 对于固定流程非常方便, 相对比较死板.
- 取证怎么取? 数据表吗?
- 怎么评价 harness 工程的效果? 需要 agent RL benchmark. 比如调用工具的准确率, 模型端到端的任务解决能力, 少工具调用和高解决效果. SWE bench
- FAE
- 遗传算法多因子虚拟币, 比较邪门歪道.
- 本体论那一套的图平台.
一面第四场
- 用 LangGraph 什么特性解决问题, 可不可以不使用 LangGraph? (状态, 节点, 边是流程执行, checkpoint 快照机制允许回退和断点使用和人工介入机制, 这两个是 LangChain 没有) 所以核心来讲是意图识别, 编排规划和 checkpoint
- checkpoint 恢复的机制是怎么样的? 也就是中断(例如服务器宕机). 具体来说副作用补偿机制, 比如说不能在有问题的节点开始恢复(否则就会一直失败), 从成功节点开始恢复.
- 向量数据库架构设计为什么分门别类呢? neo4j 一定要结构化严格验证. 口语化只需要知识库匹配. 主要是权重不一样. 主流的 RAG 方案结构化向量语义和模块化的图形语义, 会选择一个方案解决两种问题吗?
- RRF 和 reranked 解决什么问题? 提高召回率. Hybrid Retrival. 用文本块排名能缓解分数带来的权重不平衡, reranked 语义不平衡.
- RAG 是检索文本, agent 是基于自然语言调用工具. 做 PDF 的跨页表格怎么处理, 处理的效果怎么样? MinerU 版面分析和表格定位. 跨页表格判断页之间有序表关键词提醒, 以及表头相同检索. 关键字整理. 问题在于中断数据失去字段语义, 可以转换成 html, 保留 th, tr 可以识别表格标识符.
- 如果让你设计一个企业级 agent, 类似于 harness 工程的概念, 包含权限管理, 安全维护, 包含 agent, RAG, 上下文管理. 讲你的框架, 系统结构, 和每部分你会安排做什么事情. 工具调用必须设计权限观察.
AI提供的提问增强
- 在实现多路检索并行架构时,你遇到的最大性能瓶颈是什么?如何解决的?”
- “断崖检测动态截断策略中的‘断崖’具体是如何定义的?阈值是多少?为什么选这个值?”
- “LangGraph的工作流中,状态图是如何设计的?如何处理循环和错误?”
- “在微调 Qwen2.5-14B 时,你使用了什么数据集?LoRA的秩(rank)和alpha值是多少?为什么这样设置?”
- “商品名智能确认机制中的‘三级过滤’具体指哪三级?每级的准确率和召回率大概是多少?”