量化 Quantize
校准集驱动的混合精度量化,PTQ 一键压缩,QAT 精度微调,逐层误差可视化。
PIPELINE 总览
每一步都产出可校验的中间产物:量化报告 → 编译产物 → 仿真报告 → 在环日志 → OTA 包,版本化管理,全程可追溯。
校准集驱动的混合精度量化,PTQ 一键压缩,QAT 精度微调,逐层误差可视化。
面向芯片的图优化:算子融合、常量折叠、内存复用与调度,适配 NPU / MCU / DSP。
无需上板即可比对:逐层数值误差、cycle-accurate 时序、延迟与功耗预估。
真实硬件在环验证:板端 Profiler、日志回灌、异常帧复现与自动化回归。
面向海量设备的升级平面:差分增量、灰度分批、签名校验、断点续传与一键回滚。
FIVE STAGES · 五段详解
各阶段独立可运行,也可一键串联;失败可回退,产物可缓存,版本可对比。
支持 PTQ 训练后量化 与 QAT 量化感知训练 双路径。以校准集驱动分布统计,自动完成逐层敏感度分析与混合精度分配,输出可复现的量化报告。
# 1) 校准 + 量化(PTQ,200 张校准集)
huayun quantize \
--model yolov8n.onnx \
--calib coco_calib_500/ \
--precision int8 --metric kl \
--per-channel --export-report
# 报告:model_int8/quant_report.html
# 体积 12.4 MB → 3.2 MB (-74%) mAP 0.412 → 0.408 (-0.97%)
# 2) QAT 微调(可选,精度回升)
huayun qat-train --config qat.yaml --epochs 3将量化后模型编译为目标硬件可执行产物。完成 算子融合、常量折叠、布局转换、内存复用与指令调度,同一模型可编译至多款芯片。
huayun compile \
--model yolov8n_int8.onnx \
--target npu-v2 --opt O2 \
--memory-plan reuse \
--dump-perf
# Perf 预估 (NPU-v2 @ 1GHz)
# LAT 8.4 ms → 3.1 ms (×2.7)
# MEM 4.8 MB → 3.1 MB
# OPS 融合 24 ops → 16 fused-ops
huayun compile --target cortex-m55 # 同一模型,秒级多编译在主机侧完成 数值仿真 与 时序仿真,逐层对比量化前后张量,预估每层延迟与功耗。发现问题早于上板,节省 80% 调试轮次。
huayun simulate \
--artifact yolov8n_npu-v2.hyb \
--samples val_200/ --mode numeric+timing
# 数值一致性
# cos_sim mean 0.992 min 0.978 (layer 14)
# SNR 31.4 dB
# 时序 (详见报告)
# Conv_12 0.42 ms 38% | DwConv 0.18 ms
open sim_report.html # 热力图定位异常层将编译产物下发至 真实开发板 / 模组 运行。板端 Profiler 采集逐层时延、内存、带宽与功耗,异常帧自动回灌至仿真侧复现。
huayun hil run \
--artifact yolov8n_npu-v2.hyb \
--device npu-v2@192.168.1.10 \
--samples val_200/ --profile
# HIL 结果
# latency p50 3.18 ms p95 3.42 ms
# accuracy mAP 0.406 (Δ -0.006 vs 仿真)
# NPU 利用率 87% DDR 1.2 GB/s
huayun hil replay --case fail_07.jpg # 回灌复现面向海量设备的升级平面:差分增量 减小 90% 流量,灰度分批 控制爆炸半径,签名 + 验签 保障可信,断点续传 + 回滚 兜底可用。
huayun ota build \
--artifact yolov8n_npu-v2.hyb \
--from v2.3.0 --to v2.4.0 --diff
# diff 3.2 MB → 418 KB (-87%) signed ✓
huayun ota rollout \
--version v2.4.0 \
--strategy canary:1%→10%→100% \
--auto-rollback error>2%
huayun ota status v2.4.0 # 实时看板CLI · SDK · API
本地 CLI 与云端构建一致;每段可独立执行,也可 一键串联。产物与报告版本化沉淀,支持缓存命中与断点续跑。
同一套 huayun CLI,本地调试与云端流水线行为完全一致。
按模型哈希 + 配置哈希缓存,改一处只跑一处,秒级重跑。
每次运行生成可追溯的 run-id,量化/编译/仿真产物一并归档。
提供 Python SDK 与 REST API,可嵌入 CI / CD 与自有 MLOps。
# huayun pipeline — 一键串联五段,可断点续跑
huayun pipeline run \
--model yolov8n.onnx \
--calib coco_calib_500/ \
--target npu-v2 \
--hil auto \
--ota-diff --from v2.3.0
# 流水线日志
[quantize] 12.4 MB → 3.2 MB mAP 0.412 → 0.408 ✓ 4.2s
[compile] 8.4 ms → 3.1 ms mem -35% ✓ 2.1s
[simulate] cos 0.992 SNR 31.4 dB ✓ 6.8s
[hil] p50 3.18 ms HIL 184/200 ✓ 42s
[ota] diff 418 KB signed ✓ 1.1s
# 产物:runs/2026-05-13-a3f9/ 报告:pipeline.html量化、编译、仿真、在环、OTA —— 五步闭环已就绪。接入你的首个模型,30 分钟跑通全链路。
支持 ONNX · TensorFlow · PyTorch · Paddle · 私有格式可扩展