核心结论
帕特拉斯大学与enakronIC PC团队于Asia/Shanghai 9月3日公告的预印本提出,边缘工厂的检索增强助手不应以参数量或单一速度/大小代理决定压缩选型,而应在适配后以实测的RAG质量与设备吞吐量共同选型。在187页工厂手册场景中,结构提取使裁判质量相对未压缩模型下降13.7%,经检索接地蒸馏回升至仅差4.6%,约恢复三分之二损失;同一助手可在Jetson Orin Nano、RevPi Connect 5与Arduino UNO Q三档硬件上分别以4.96W、2.48W与1.30W待机运行。该结论为预印本作者实验结果,未经同行评审且限于受控评测。
方法与数据范围
研究将部署问题拆为三阶段:先以三明治式原地蒸馏训练权重共享超网络,在Llama-3.2 3B与1B两基座上形成11点校准候选网格(3B为2.20-3.21B,1B为0.90-1.24B),每步同时训练全量网络与采样子网络并以重要度校准采样;再对候选中每一个进行检索接地后提取蒸馏,将187页轧机操作手册切分为1460个100-token重叠块,按块生成686对训练问答与633题留出集,用未压缩教师在生产提示模板与Top-4检索上下文下重答,并以0.5概率混入RAFT干扰块,通过LoRA(rank 8)与温度2.0的软蒸馏适配;最后将抽取的子网络量化导出(GPU用W8A16 ONNX,Arm用Q4_K_M GGUF)并接入语法约束的工具路由运行时,统一提示、检索与问询在三平台保持一致。
评估设计强调适配后测量:与预适配准确率预测不同,作者对网格中每一候选均完成适配、导出与上机实测,再按归一化质量与吞吐的加权混合在能力地板与显存上限约束下选型;吞吐用三锚点拟合预测,其余8档误差仅2.5%-3.1%,选型结果与全量实测一致。
评估条件与主要结果
所有质量分数均在单次裁判会话内、同一检索栈下、以Claude Opus 4.8对忠实度、答案相关性与上下文利用率打分,跨会话绝对值不可比;效率指标为同设备同格式下的TTFT、TPS、端到端时长、峰值显存与单次/待机能耗。
- 1)能力与规模解耦:ARC-Easy随参数线性下降(R²=0.93),而适配后RAG质量仅弱相关(R²=0.76),Rank 6与最大候选质量相当,验证适配后选型的必要性。 2)提取-恢复:在问答质量上,3B rank-6提取相对基线降13.7%,检索蒸馏后回至-4.6%(633题,Bootstrap 95% CI -5.9%至-3.3%),恢复约三分之二;上下文无关微调反而降至0.654(提取态0.701),而接地任务损失、软蒸馏与RAFT依次提升至0.727、约+3分与0.765。 3)选型对比:在RevPi上,大小/速度单目标选型保留能力仅69%-74%,质量单目标忽略吞吐;约束混合在w∈[0.15,0.85]均稳定选出rank-6(1B网格为rank-5),能力地板移除的候选恰为无约束混合的优选。 4)跨平台落地:三平台待机分别为Jetson 4.96W、RevPi 2.48W、UNO Q 1.30W;加入37条路由演示后工具路由均达40/40,仅损失1.3-2.5个RAG分。
限制与不确定性
上述提升为局部、受控条件下的作者实验结果,不能推广为普遍或因果结论。除预印本未同行评审与单次裁判依赖外,研究仅基于单份手册与固定检索器,检索召回未测量;633题规模的CI与不同网格分会话评测使跨条件比较需谨慎;80%能力地板等策略参数在其他文档或阈值下可能改变选型;小模型在多步推理、长链工具调用与计数类视觉任务上仍不可靠,且现场网络、散热与连续运行条件未覆盖。
同行评审状态与潜在意义
该工作为9月3日首次公告的预印本(arXiv:2609.02760v1,提交时间2 Sep 2026 16:00:05 UTC,对应Asia/Shanghai 3 Sep 00:00:05;当日公告批次标题为Thu, 3 Sep 2026,属cs.AI 58篇新提交之一),截至检索时未见期刊或会议正式接收信息。其意义在于将边缘部署从压缩即部署转为适配后测量选型,以权重共享与三锚点预测降低选型成本,并通过检索接地蒸馏在资源受限前提下保留文档接地质量,为车间本地化助手提供了可复用的工程范式,但向生产落地仍需独立验证与召回端优化。