NVFP4 چیست و چرا انویدیا به ۴ بیت رسید؟
در آغاز عصر مدلهای زبانی بزرگ، اجرای مدلها با فرمت BF16 بالاترین دقت را داشت اما حجم سنگین حافظه و سرعت پایین، پردازندهها را فلج میکرد. با مهاجرت صنعت به FP8، مصرف حافظه نصف شد…
در آغاز عصر مدلهای زبانی بزرگ، اجرای مدلها با فرمت BF16 بالاترین دقت را داشت اما حجم سنگین حافظه و سرعت پایین، پردازندهها را فلج میکرد. با مهاجرت صنعت به FP8، مصرف حافظه نصف شد و سرعت جهش چشمگیری یافت، اما انفجار ابعاد مدلهای چندصد میلیاردی دوباره محدودیتهای فیزیکی حافظه را به چالش کشید. فرمتهای ۴ بیتی سنتی گرچه حافظه را آزاد میکردند، اما هوشمندی مدل را از بین میبردند. اینجا بود که انویدیا NVFP4 را خلق کرد؛ فرمت انقلابی ۴ بیتی که توانست با بهینهسازی حداکثری حافظه و ثبت رکورد در سرعت پردازش، برای نخستین بار دقت مدل را در سطحی نزدیک به دقت اولیه حفظ کند.
فهرست مطالب
- فرمت NVFP4 چیست و چگونه استنتاج مدلهای
هوش مصنوعی را دگرگون میکند؟ - ساختار پایهای NVFP4
- چالش بزرگ دقت در فرمتهای ۴ بیتی
- مقیاسبندی با دقت بالا
- چرا NVFP4 از نسلهای قبلی هوشمندتر عمل میکند؟
- جمع بندی
فرمت NVFP4 چیست و چگونه استنتاج مدلهای هوش مصنوعی را دگرگون میکند؟
با بزرگتر شدن ابعاد مدلهای زبانی بزرگ LLM)ها( و شبکههای عصبی عمیق، یکی از بزرگترین چالشهای مهندسی هوش مصنوعی، کاهش مصرف حافظه و افزایش سرعت پردازش (Inference) بدون از دست رفتن دقت مدل است. تکنیکهای کوانتیزاسیون (Quantization) کلید حل این چالش هستند.
شرکت انویدیا همزمان با معرفی نسل جدید پردازندههای گرافیکی Blackwell، از فرمت ممیز شناور ۴ بیتی جدیدی تحت عنوان NVFP4 رونمایی کرد. این فرمت با بازطراحی ساختار مقیاسبندی و کوچکتر کردن بلوکهای محاسباتی، استاندارد جدیدی را برای فشردهسازی مدلها در لبه دقت و کارایی تعریف میکند.
ساختار پایهای NVFP4
فرمت NVFP4 بر پایه معماری دادههای ممیز شناور با بیت پایین (Micro Floating-Point) ساخته شده است. ساختار بیتهای این فرمت از نوع E2M1بوده و شامل اجزای زیر است:
- ۱ بیت علامت (Sign): مثبت یا منفی بودن عدد.
- ۲ بیت توان (Exponent): بازه دینامیکی مقدار.
- ۱ بیت مانتیس (Mantissa): بخش اعشاری عدد.
با این چینش، بازه مقادیر قابل نمایش در NVFP4 تقریباً بین [−6,+6 ] قرار میگیرد و اعدادی مانند
(6.0, 4.0, 3.0, 2.0, 1.5, 1.0, 0.5, 0.0 (به همراه قرینه منفی آنها) را پوشش میدهد.
چالش دقت در فرمتهای ۴ بیتی و راهحل نوآورانه NVFP4
یکی از چالشهای بنیادین در فرمتهای عددی با دقت بسیار پایین (Ultra-low precision)، حفظ دقت عددی در سراسر «گستره دینامیکی» (Dynamic Range) تنسورهاست. در مدلهای هوش مصنوعی، تنسورها اغلب دارای توزیع ناهمگنی از مقادیر هستند (ترکیبی از اعداد بسیار کوچک و بزرگ)؛ لذا فشردهسازی مستقیم آنها معمولاً به بروز «خطای کوانتیزاسیون» و از دست رفتن اطلاعات حساس مدل منجر میشود.
انویدیا برای غلبه بر این محدودیت در NVFP4، دو نوآوری معماری را معرفی کرده است که استنتاج هوش مصنوعی را به سطح جدیدی از کارایی و دقت میرساند:
- رمزگذاری مقیاس با دقت بالا (High-precision scale encoding)
- استراتژی مقیاسبندی دو سطحی (Two-level micro-block scaling)
مکانیسم عمل:
برای حفظ دقت محاسباتی، NVFP4 از یک استراتژی دو مرحلهای هوشمندانه استفاده میکند که در آن ابتدا تنسور به دستههای ۱۶تایی کوچک تقسیم میشود تا برای هر کدام یک فاکتور مقیاسبندی دقیق از نوع E4M3 در نظر گرفته شود. همزمان، یک لایه مقیاسبندی کلی با دقت FP32 نیز روی کل تنسور اعمال میگردد؛ این ترکیب دوگانه باعث میشود که مدل حتی پس از فشردهسازی شدید به ۴ بیت، جزئیات و هوشمندی خود را حفظ کند و خطای محاسباتی به حداقل برسد.
مقیاسبندی با دقت بالا
یکی از برگهای برنده NVFP4 در حفظ کیفیت مدل، بهرهگیری از قابلیتی به نام «مقیاسبندی با دقت بالا» است. این فرمت برای رمزگذاری میکروبلوکها از استاندارد E4M3 (در قالب FP8) استفاده میکند. تفاوت مهم NVFP4 در این است که برخلاف روشهای قدیمی که مقیاسها را تنها به توانهای
عدد ۲ محدود میکردند، این فرمت آزادی عمل دارد تا از فاکتورهای مقیاسبندی کسری و غیرتواندو
استفاده کند. این انعطافپذیری باعث میشود مدل بتواند توزیع واقعی دادههای موجود در تنسور را با
دقت بسیار بالاتری شبیهسازی کند. نتیجه نهایی این رویکرد هوشمندان که باعث
کاهش چشمگیر خطا و حفظ کیفیت هوشمندی مدل در مقایسه با روشهای سادهتری مانند E8M0 است.
چرا NVFP4 از نسلهای قبلی (مانند MXFP4) هوشمندتر عمل میکند؟
رمز موفقیت NVFP4 در دو نوآوری فنی نهفته است که اجازه میدهد مدلهای هوش مصنوعی بدون افت دقت، در فرمت ۴ بیتی اجرا شوند:
- کاهش ابعاد برای تطبیق هوشمند: در نسلهای قبلی مانند MXFP4، دادهها در بلوکهای ۳۲ تایی گروهبندی میشدند. اما در NVFP4 ، این گروه به بلوکهای ۱۶ تایی تقسیم شده است. این کاهش اندازه به سیستم اجازه میدهد تا به جای یک مقیاسبندی کلی (چتری) برای کل تنسور، بسیار دقیقتر و محلیتر عمل کند. به زبان ساده، سیستم اکنون میتواند اعداد بزرگ و کوچکِ نزدیک به هم را بهتر شناسایی و با دقت متناسب با همان ناحیه، مقیاسبندی کند.
- استفاده از مقیاسبندی پویا (Fractional Scaling): برخلاف روشهای قدیمی که مقیاسبندی را تنها به توانهای عدد ۲ محدود میکردند، NVFP4 از دقت E4M3 FP8 استفاده میکند. این یعنی فاکتورهای مقیاس میتوانند دقیقتر و کسری باشند که باعث میشود «وفاداری» اعدادِ ۴ بیتی به دادههای اصلی، بسیار بیشتر شود.
در نهایت، هر مقدار ۴ بیتی(xq) درون یک میکروبلوک، با ضرب شدن در یک فاکتور مقیاس پویا(s) که به صورت اختصاصی برای همان گروه ۱۶ تایی محاسبه شده، به مقدار دقیق خود بازسازی میشود. این «ظرافت در مقیاسبندی» همان دلیلی است که باعث میشود NVFP4 علی رغم حجم بسیار کم، عملکردی در حد فرمتهای سنگینتر ارائه دهد و هوشمندی مدل را کاملاً حفظ کند.
جمع بندی
NVFP4 با جایگزینی روشهای قدیمی و استفاده از «میکروبلوکهای هوشمند»، توانسته چالش افت دقت در کوانتیزاسیون را به بهترین شکل حل کند؛ نوآوری کلیدی که اجرای مدلهای عظیم را روی سختافزارها، بسیار سریعتر و بهینهتر از قبل میکند.
در بخش بعد با ما همراه باشید تا عملکرد واقعی این روش و نتایج مدلهای کوانتایز شده را با هم مشاهده کنیم.
NVFP4 فرمت ۴ بیتی جدید انویدیا برای افزایش سرعت و کاهش مصرف حافظه مدلهای هوش مصنوعی است. برخلاف روشهای قدیمی، این فرمت با استفاده از «میکروبلوکهای ۱۶تایی» و مقیاسبندی هوشمند، دقت و هوشمندی مدل را بدون افت حفظ میکند.
این فرمت و شتابدهی سختافزاری مقیاسبندی میکروبلوکهای آن بهصورت بومی توسط هستههای نسل پنجم Tensor Core در معماری پردازندههای گرافیکی NVIDIA Blackwell پشتیبانی میشود.
NVFP4 با کاهش چشمگیر مصرف حافظه و افزایش سرعت پردازش، اجرای مدلهای بزرگ را روی سختافزارهای Edge AI با مصرف انرژی کمتر ممکن میسازد.



