刘明琦LIU Mingqi

山东大学 · 数学学院 · 本科四年级 意向方向:多模态大模型 / AI Agent / 后训练 / RAG

Tel 19720546183 liumq@mail.sdu.edu.cn
Embodied AI Multimodal LLM AI Agents GPU 算子
θt+1 = θt − η ∇θ 𝓛(θt)
1. Mathematics
系统的数学训练
分析、代数、回归模型和机器学习,用数学语言理解模型
2. AI-assisted Coding
熟练的工程能力
熟练使用 Codex、DSH 等 Agent 协同编码,以数值对拍与指标对比保证正确性
3. Implementation
底层开发能力
从 MLP / RNN 实践逐步深入 Transformer;CANN GPU 开发高效算子

01教育背景Education

山东大学

2023.09 — 2027.07(预计)
数学学院 · 统计学|四年级在读
本科课程
数学分析高等代数概率论数理统计泛函分析精算数学机器学习应用回归分析

02实践和项目经历Selected Projects

CANN Erf昇腾 NPU 算子开发与性能调优

竞赛项目 · 2026.04—05 C++Ascend CCANNCMakemsprof
  • 完成 float32 Erf 算子全链路开发:算子注册、形状/类型推导、Host Tiling、多核 Kernel 与 GM↔UB 搬运;调用 AscendC::Erf,兼容多维与非对齐输入,官方测试 15/15 通过,输出错误占比 0.00%。
  • 设计 5 段规模策略,按输入长度调整核数与 tile(512–8192 元素),结合单/双缓冲、预取流水及末核长度控制;阶段得分 64 → 85.12,提升 21.12 分。
  • 建立重复提交与中位数对比方法,量化黑箱评测波动;代表大张量测试点耗时下降 约 32%,优化前后数据如下。
竞赛测试点:首版与 85.12 分阶段提交对比
测试点 首版耗时 调优耗时 耗时下降
Case 32.46 ms1.66 ms32.5%
Case 93.21 ms2.16 ms32.7%
Case 157.60 ms5.17 ms32.0%
  • 在 NPU 服务器开展 msprof 剖析,基于 805 份 profiling 记录中的 30 个基线配置分析引擎活动:小规模 Scalar 比例约 48%–71%,1M–16M 元素时 Vector 比例 74.1%–93.8%;本地 1M / 16M 元素的 Kernel Task 耗时为 14.08 / 152.88 μs。
  • 定位 Tiling 分段边界性能突变:N 从 32768 增至 32769 时,Task 耗时 3.98 → 6.70 μs(+68.3%),MTE2 比例 21.7% → 38.5%;据此提出核数与分块粒度平滑方案。

MNIST-NumPy从零实现 MNIST 神经网络

学习项目 PythonNumPyBackpropagation
  • 使用 NumPy 实现 784 → 100 → 10 两层全连接网络,贯通前向计算、交叉熵损失、反向传播与 SGD 更新
  • 通过数值梯度检查验证反向传播,误差量级 10−9;测试集准确率 ≈97.5%

Torch-RNNPyTorch 分类模型与字符语言模型

学习项目 PyTorchAutogradRNN
  • 将手写网络迁移到 PyTorch,使用 DataLoader 与 SGD 训练(batch size 64、学习率 0.2),MNIST 准确率 ≥97%
  • 字符级语言模型:Embedding(65, 32) → RNN(32, 128) → Linear(128, 65),以历史字符预测下一字符分布

Agent-Skills考研备考:学习资料处理与可视化工具链

个人项目 · 2026.07—08 PythonObsidianSVGAgent Skills
  • 结合笔记软件 Obsidian 搭建资料库
  • 主导笔记需求分析与迭代验收,将学习资料库整理流程封装为 4 套可复用 Agent Skills,覆盖 Obsidian Canvas、计算机专业课 SVG 知识图、HTML 交互动画及全尺寸 PDF 导出;组织规范、模板与脚本,支持分享和跨任务复用。
  • 开发 Python / JavaScript / PowerShell 工具脚本,实现思维导图笔记的 Json 编码插件、Canvas 白板的引用与布局校验、SVG 字段比例与时序坐标检查;通过渲染复核定位文字裁切、连线遮挡和导出缩放问题。

Math-OCR数学题库结构化与自动排版

个人项目 · 2026.09—10 PythonVision OCRAgentsLaTeX GitHub↗:https://github.com/Kylaan/marginnote-ocr-latex
  • 结合笔记软件 MarginNote 搭建OCR识别工作流
  • 构建 MarginNote 拆包 → 视觉 OCR → Agent 分片与复核 → LaTeX 工作流,恢复 SQLite 知识树、题源与稳定 ID
  • 实现 JSON Schema 校验、断点续跑与原子写入;用人工更正覆盖层保留核图证据,检查任务唯一性与结果完整性
  • 归档 391 道数学题、915 张原图,生成 58 / 80 页双版本 PDF;6 项离线测试与 GitHub Actions 全部通过

Homeserver多服务容器化部署与 AI Agent 实践

个人项目 · 长期维护 Docker ComposeLinuxNginxAI Agent
  • 在家庭 NAS 上用 Docker Compose 长期维护 20+ 容器服务(PostgreSQL、n8n、NapCat、LibreChat、Jellyfin、Anki 同步等),统一按「独立 compose 目录 + 绑定挂载 + restart 策略」组织,做到单服务可重建、数据不丢
  • 硬件转码与推理容器注册 NVIDIA runtime(GTX 1060 6GB / 驱动 580),CUDA runtime
  • 搭建消息归档链路:NapCat webhook → PostgreSQL 入库 → n8n 编排 Markdown / HTML 转换与 Obsidian 归档,替代原先的手工整理
  • 部署 AI Agent 侧服务:自建 DSH / Hermes Agent 执行环境并接入 QQ 作为交付通道,对接 OpenAI 兼容 API 网关并处理密钥与反向代理
  • 排障实践:定位 volume 挂载与镜像 VOLUME 路径不一致导致的数据落在匿名卷、容器 UID 与绑定挂载权限冲突、代理环境变量污染导致 DNS 失败等问题

03研究与学习计划Research & Study Plan

MiniLLM:从零实现现代 Decoder-only Transformer

计划开展
  • 以 PyTorch 从零实现 RMSNorm、RoPE、Causal Self-Attention、GQA、SwiGLU 与 KV Cache,建立从数学公式到张量计算的完整理解。
  • 围绕 MHA / GQA / MQA 与有无 KV Cache 进行消融与性能对比,记录验证损失、显存占用、生成延迟与 tokens/s。

数学推理大模型后训练:SFT → DPO / GRPO

计划开展
  • 基于开源小参数模型开展 LoRA / QLoRA、SFT、DPO 与 GRPO,构建可复现的数学推理后训练与评测流程。
  • 设计 MathVerifier 对数值、分式与符号表达式进行自动校验;比较 Base / SFT / DPO / GRPO 在准确率、Pass@1、训练显存与样本效率上的差异。

高效 LLM 推理:KV Cache、量化与 Serving 优化

计划开展
  • 建立权重与 KV Cache 显存模型,分析上下文长度、GQA 与精度格式对显存和推理复杂度的影响。
  • 比较 Transformers 与 vLLM 在不同 context、batch、concurrency 和 FP16 / INT8 / INT4 配置下的 TTFT、TPOT、吞吐率、峰值显存与任务精度。