Es wurde ein unterschiedlicher Inferenzdurchsatz beobachtet, wenn dieselbe Modellarchitektur mit verschiedenen Gewichtungsdateien ausgeführt wurde. Obwohl die Modellstruktur identisch ist, variiert die Inferenzleistung je nach verwendeter Gewichtsgenauigkeit und Darstellung erheblich.
Modellgewichte und -genauigkeit (FP32, FP16, INT8) beeinflussen die Inferenzleistung.
Die Verwendung des FP32-Formats würde zu einer vollständigen Gewichtsverteilung führen und wird als Single Precision Floating Point bezeichnet.
In der Zwischenzeit sind FP16- und INT8-Formate beide komprimierte Gewichtsformate, bei denen sie gequetscht werden, um kleiner zu sein. Der Kompromiss für diese Komprimierungen ist die Genauigkeit des Modells, auch bekannt als Quantisierungsfehler.
Je mehr Bits der Darstellung von Daten zugewiesen werden, desto größer ist der Bereich, den sie darstellen können, und desto genauer ist potenziell das Modell. Größere Daten erfordern jedoch mehr Speicherplatz und eine höhere Speicherbandbreite, die für die Übertragung erforderlich ist, sowie mehr Rechenressourcen und Zeit, die verbraucht wird.
Die Intel® Distribution des OpenVINO™ Toolkit Benchmark-Ergebnisse zeigen offensichtliche Unterschiede in Bezug auf die Leistung zwischen verschiedenen Gewichtsformaten oder die Präzision.