Skip to main content

vLLM

推测解码

GPU

Harness Engineering

Harness Engineering 指的是一种开发方式:工程师不直接写大量代码,而是设计环境、规则和测试反馈系统,让 AI Agent 自动生成并改进代码。

自动化 AI 研究

  • autoresearch — 让 AI Agent 在单 GPU 上自动修改 nanochat 训练代码,以固定 5 分钟预算运行实验、评估结果并保留有效改动,形成最小化的自动研究闭环。
  • First Steps Toward Automated AI Research — Recursive 对自动研究系统的早期实践总结,涵盖长周期并行探索、结果验证,以及在 NanoChat、NanoGPT Speedrun 和 GPU Kernel 优化任务上的实验。

量化

CUTLASS

Triton

FlashAttention

CUDA