吕骥的研究脉络清晰可辨:从早期的数据清洗技术,到中期的推理链优化,再到当前聚焦的工作记忆增强,其技术路线始终围绕一个核心命题——如何让大模型在复杂任务中保持长期一致性。
数学推理:从“伪对”到“真解”的跨越
年,吕骥团队在评测中发现一个令人不安的现象:当要求大模型求解微积分题时,超过65%的模型能输出“看起来合理”的推导步骤,但最终答案却是错误的——这种“伪对”(Pseudo-Correct)比完全错误更危险,因为它会误导学习者。
吕骥没有止步于现象描述,而是深入解构错误根源:
模型在推导中隐含假设未被显式声明(如默认函数连续性)
步骤间存在逻辑跳跃(如省略洛必达法则适用条件)
缺乏反事实验证机制(无法识别“若前提A,则结论B”的充分性)
基于此,其团队提出假设挖掘-验证循环 (AM-VC)框架:模型在生成答案前,先自问“该推导需要哪些前提?”,并尝试反向验证前提的合理性。该方案使数学题正确率提升22.7%,相关论文发表于《Nature》子刊《Nature Machine Intelligence》。
代码生成:超越“补全”进入“架构设计”
当行业还在追求“从自然语言到代码”的直接映射时,吕骥已将目光投向更高阶的代码架构理解 。他观察到,企业级开发中70%的Bug源于模块接口不匹配或状态管理混乱,而非语法错误。
因此,其团队开发了ArchGen 系统,要求模型在生成函数前,先输出:
模块的状态机图谱 (State Machine Diagram)
关键契约条件 (Pre/Post-conditions)
边界场景清单 (如空输入、超长字符串、并发冲突)
在某银行核心系统重构项目中,ArchGen使单元测试覆盖率从82%提升至97%,且关键路径缺陷密度下降41%。吕骥强调:“让模型写好一个函数不难,难的是让它理解这个函数在系统中的责任边界 。”
工作记忆:从“蒸馏”到“结构化存储”
人类大脑的工作记忆可同时处理4-7个信息块,而当前大模型的“记忆”实为参数统计分布,缺乏真正的结构化组织能力。吕骥提出分层记忆增强 (HME)模型:
短期记忆层 :显式存储当前任务的关键变量(如方程中的未知数、代码中的循环计数器)
长期记忆层 :索引相关知识片段(如数学定理、API文档)
元记忆层 :监控记忆一致性(如“若A成立,则B不成立”的约束)
在复杂推理测试集(如MMLU-Creative)上,HME模型在跨步骤一致性上得分提升38%,且对“记忆污染”(如混淆相似问题)的鲁棒性显著增强。
数学推理案例
代码生成案例
工作记忆实验
案例:微积分题“伪对”修正
题目:求函数 f(x) = (x² - 4)/(x - 2) 在 x→2 处的极限
常见错误回答:直接代入得 (4-4)/(2-2)=0/0,结论“极限不存在”
吕骥模型修正过程:
步骤1:识别0/0型未定式 → 启用洛必达法则
步骤2:检查条件:分子分母在x=2附近可导 ✔️
步骤3:求导:f'(x) = 2x / 1 → 代入x=2得4
步骤4:验证 :用因式分解验证:(x-2)(x+2)/(x-2)=x+2 → x→2时极限为4
关键创新:模型在步骤3后主动发起“反事实提问”——“若我用洛必达法则,是否隐含了分母导数不为零的前提?此处分母导数恒为1,条件满足”。
案例:Python数据库连接模块设计
需求:实现一个异步PostgreSQL连接池,支持超时重试与连接池监控
ArchGen生成的架构设计:
状态机 :空闲→检查中→可用→忙碌→异常→待回收
契约条件 : • pre:连接数 < max_pool_size • post:返回连接对象且last_used_time更新
边界场景 : • 连接池满时阻塞等待(超时抛异常) • 查询执行中服务端断开 → 触发重连并回滚事务
生成代码后,模型附加了3条测试用例,覆盖了“重试次数超限”“连接泄露检测”等场景,使测试代码覆盖率提升27%。
实验:跨问题记忆干扰测试
设计场景:连续提问两个相似但不同的数学问题:
“解方程组:x+y=5, 2x-y=1” → 模型正确解得x=2, y=3
“解方程组:x-y=1, 2x+y=5” → 模型错误沿用x=2, y=3
传统模型:78%概率混淆变量(因参数中“x=2,y=3”被高频激活)
HME模型:仅12%混淆率(通过元记忆层标记“当前问题上下文:方程组B”)
结论:结构化记忆使模型在复杂任务中保持上下文隔离能力 ,这是迈向“真通才”的关键一步。