Answer-Conditioned Chain-of-Thought Distillation for Few-Shot Industrial Vision with Small VLMs
本論文は、正解ラベルに基づいた推論を生成することが、直接的なファインチューニングや、最小限のデータで訓練されたGPT-4のようなより大規模なモデルをも大幅に上回ることを示し、少数のショットによる産業用外観検査タスクへ小型の視覚言語モデルを迅速に適応させるための、回答条件付き思考連鎖蒸留(answer-conditioned chain-of-thought distillation)を提案するものである。