AI 应用 / Agent 方向 · 独立开发者

肖珺予

大模型应用 × Agent 系统 × 推理工程

这里是我的个人项目集:四套可运行的工程系统,从 Multi-Agent 协同架构到8GB 显卡上跑通 27B 模型的 64K 长上下文推理, 全部开源、全部可在线体验——每个指标背后都有测试日志可复核。

西安2 年+ 企业数字化系统独立交付工业工程科班 · 流程量化思维

64Kctx27B 模型长上下文极限调优
8GB 显存峰值受控 7.88GB
20/20Multi-Agent 冻结用例任务达标
未授权物理写入 0 次
0.9154RAG 向量 + BM25 混合召回
实测 MRR@5
100+测评系统累计服务企业员工
已在生产环境稳定运行
SELECTED WORK

精选项目

点击项目卡片内的按钮,直达在线演示或 GitHub 仓库——数字不是估计值,是可复核的实验结果。

01

IncidentOps

企业级故障排查 Multi-Agent 协同系统 · 独立开发

把"多智能体协同"做成可审计的工程:四角色分工、证据链闭环、高危操作强制人工审批。

  • 四智能体分工与门禁流:Coordinator 统筹、Diagnosis 只读探针诊断、Remediation 检索 SOP 拟草案、Review 审查闭环;写操作强制人工审批,未授权物理写入保持 0 次。
  • 自研 SSE 增量流式解析状态机:解决长文本生成断句与截断,支撑排障推演状态机跟踪与证据链溯源下钻。
  • MCP 协议 + pgvector 检索:标准化运维工具库封装,SOP 规程向量检索并强制挂载元数据引用(Metadata Lineage),抑制幻觉。
  • 独立评测集验证:20 个冻结合成用例(权限异常、网络抖动、格式不符)任务达标率 20/20,事实依据支撑率 20/20,配套 68 例 pytest 自动化测试。
Multi-Agent 编排SSE 增量解析MCP 协议Supabase pgvectorHuman-in-the-Looppytest
在线演示 ↗ GitHub 仓库 合成数据交互 · 含评测记录
02

Bonsai · 本地大模型推理网关

8GB 显卡上的 27B 模型与 64K 长上下文工程 · 独立开发

一次推理 Infra 的极限工程:在 RTX 5060 Laptop 8GB 上,把 Bonsai-2-27B(三值化权重)的 65,536 上下文跑稳、跑快、跑出可复现的基准。

  • 显存硬预算与两级动态闸门:推导 65,536 − 8,192 − 1,024 = 56,320 token 硬预算;0.3ms Reject + 1.2ms Floor 两级拦截,拦截开销较直通后端降低 99.8%,物理显存峰值严格受控 7.88GB。
  • Prefix Cache 对齐:规范 System Prompt 与 Tool Schema 静态拓扑序列,前缀命中率 0% → 75%+,多轮重灌从 60 秒级降至亚秒级(首字 TTFT ≈ 705ms)。
  • 双内核架构与边界修复:PrismML 稳态基准 + NInfer 异构加速;修复 KVMem frontier 边界条件与 capacity 检查,消除高上下文死锁与隐式崩溃。
  • 基准实测:12 个固定冷热任务质量回归 12/12 达标;稳态档 24.9~28.5 token/s,MTP 投机加速档 45~55+ token/s,任务总耗时中位数缩短 38%。
llama.cpp / NInferPython FastAPIKV-Cache 硬预算Prefix CacheMTP 投机解码SSEParser
全景文档 ↗ GitHub 仓库 完整实验记录 · 12 任务基准可复现
03

职业人岗匹配测评系统

已在企业上线稳定运行 · 独立设计与交付

从需求到上线零外包:融合五套权威量表的员工测评系统,成为部门岗位配置的核心依据。

  • 多维量表融合:融合 MBTI、大五、PDP、DISC、九型等权威量表,替代高价外部采购,独立交付全流程在线测评。
  • 安全与合规:Supabase Row Level Security 行级鉴权与防篡改,部署于 Cloudflare Pages。
  • 业务成效:上线两个月累计 100+ 名员工完成测评并生成报告,成为部门岗位配置核心依据。
ViteSupabase RLSChart.jsExcelJSCloudflare Pages
在线系统 ↗ GitHub 仓库 生产环境运行中 · 100+ 真实用户
04

Smart HR Platform

规则即数据的考勤薪酬系统 · 独立开发

针对集团薪酬制度多变的痛点,用"规则即数据"架构把业务规则从代码里解放出来。

  • 规则即数据:考勤扣罚与补贴规则存为数据库结构化数据,修改规则免改代码。
  • 12 步薪酬自动化公式链:社保个税、考勤扣罚等流水线计算,前后端共享统一数据字典,生成全生命周期审计轨迹。
React 18TypeScriptNode.js ExpressSQLite规则引擎
GitHub 仓库 全栈可运行 MVP · 模拟数据验证

不止这四个。GitHub 上还有 20+ 个公开仓库,覆盖工具、实验与练习。

查看全部仓库
TECH STACK

技术栈

上面每个项目用到什么,这里就列什么——不是清单堆砌,是实际用过的东西。

LLM 推理与显存Infra

llama.cppvLLMNInferCUDA 运行时GGUF / PTQ 量化KV-Cache 硬预算Prefix CacheMTP 投机解码LoRA / PEFT

Agent 编排Agents

Multi-Agent 分层协同ReAct / ReflectionTool CallingMCP 标准协议Human-in-the-LoopSSE 流式状态机

RAG 与知识工程Retrieval

向量 + BM25 混合召回MRR@5 0.9154 实测Metadata LineageSupabase pgvector嵌入与重排序

全栈与部署Full-Stack

Python · FastAPI · AsyncIOTypeScript · React 18 · Next.jsJavaPostgreSQL · Supabase RLS · RedisDockerCloudflare Pages / Workers

对一个项目感兴趣?
或者想聊聊合作。

AI 应用 / Agent 开发 / LLM 推理优化方向均开放机会,随时到岗。
建议先点开 IncidentOps 在线演示或 Bonsai 全景文档,再聊。

已复制到剪贴板