NVFP4 چیست و چرا انویدیا به ۴ بیت رسید؟

نویسنده:
شرکت پیشرو Ai
تاریخ انتشار:
11 شهریور 1405
دیدگاه ها:
what-is-nvfp4-nvidia-blackwell

در آغاز عصر مدل‌های زبانی بزرگ، اجرای مدل‌ها با فرمت BF16 بالاترین دقت را داشت اما حجم سنگین حافظه و سرعت پایین، پردازنده‌ها را فلج می‌کرد. با مهاجرت صنعت به FP8، مصرف حافظه نصف شد…

در آغاز عصر مدل‌های زبانی بزرگ، اجرای مدل‌ها با فرمت BF16 بالاترین دقت را داشت اما حجم سنگین حافظه و سرعت پایین، پردازنده‌ها را فلج می‌کرد. با مهاجرت صنعت به FP8، مصرف حافظه نصف شد و سرعت جهش چشمگیری یافت، اما انفجار ابعاد مدل‌های چندصد میلیاردی دوباره محدودیت‌های فیزیکی حافظه را به چالش کشید. فرمت‌های ۴ بیتی سنتی گرچه حافظه را آزاد می‌کردند، اما هوشمندی مدل را از بین می‌بردند. اینجا بود که انویدیا NVFP4 را خلق کرد؛ فرمت انقلابی ۴ بیتی که توانست با بهینه‌سازی حداکثری حافظه و ثبت رکورد در سرعت پردازش، برای نخستین بار دقت مدل را در سطحی نزدیک به دقت اولیه حفظ کند.

 

فهرست مطالب

  • فرمت NVFP4 چیست و چگونه استنتاج مدل‌های
    هوش مصنوعی را دگرگون می‌کند؟
  • ساختار پایه‌ای NVFP4
  • چالش بزرگ دقت در فرمت‌های ۴ بیتی
  • مقیاس‌بندی با دقت بالا
  • چرا NVFP4 از نسل‌های قبلی هوشمندتر عمل می‌کند؟
  • جمع بندی

فرمت NVFP4 چیست و چگونه استنتاج مدل‌های هوش مصنوعی را دگرگون می‌کند؟

با بزرگ‌تر شدن ابعاد مدل‌های زبانی بزرگ LLM)ها( و شبکه‌های عصبی عمیق، یکی از بزرگ‌ترین چالش‌های مهندسی هوش مصنوعی، کاهش مصرف حافظه و افزایش سرعت پردازش (Inference) بدون از دست رفتن دقت مدل است. تکنیک‌های کوانتیزاسیون (Quantization) کلید حل این چالش هستند.

شرکت انویدیا هم‌زمان با معرفی نسل جدید پردازنده‌های گرافیکی Blackwell، از فرمت ممیز شناور ۴ بیتی جدیدی تحت عنوان NVFP4 رونمایی کرد. این فرمت با بازطراحی ساختار مقیاس‌بندی و کوچک‌تر کردن بلوک‌های محاسباتی، استاندارد جدیدی را برای فشرده‌سازی مدل‌ها در لبه دقت و کارایی تعریف می‌کند.

 

 

ساختار پایه‌ای NVFP4

فرمت  NVFP4 بر پایه معماری داده‌های ممیز شناور با بیت پایین (Micro Floating-Point) ساخته شده است. ساختار بیت‌های این فرمت از نوع  E2M1بوده و شامل اجزای زیر است:

  • ۱ بیت علامت (Sign): مثبت یا منفی بودن عدد.
  • ۲ بیت توان (Exponent): بازه دینامیکی مقدار.
  • ۱ بیت مانتیس (Mantissa): بخش اعشاری عدد.

با این چینش، بازه مقادیر قابل نمایش در NVFP4 تقریباً بین [−6,+6 ] قرار می‌گیرد و اعدادی مانند

(6.0, 4.0, 3.0, 2.0, 1.5, 1.0, 0.5, 0.0  (به همراه قرینه منفی آن‌ها) را پوشش می‌دهد.

چالش دقت در فرمت‌های ۴ بیتی و راه‌حل نوآورانه NVFP4

یکی از چالش‌های بنیادین در فرمت‌های عددی با دقت بسیار پایین (Ultra-low precision)، حفظ دقت عددی در سراسر «گستره دینامیکی» (Dynamic Range) تنسورهاست. در مدل‌های هوش مصنوعی، تنسورها اغلب دارای توزیع ناهمگنی از مقادیر هستند (ترکیبی از اعداد بسیار کوچک و بزرگ)؛ لذا فشرده‌سازی مستقیم آن‌ها معمولاً به بروز «خطای کوانتیزاسیون» و از دست رفتن اطلاعات حساس مدل منجر می‌شود.

انویدیا برای غلبه بر این محدودیت در NVFP4، دو نوآوری معماری را معرفی کرده است که استنتاج هوش مصنوعی را به سطح جدیدی از کارایی و دقت می‌رساند:

  • رمزگذاری مقیاس با دقت بالا (High-precision scale encoding)
  • استراتژی مقیاس‌بندی دو سطحی (Two-level micro-block scaling)

مکانیسم عمل:

برای حفظ دقت محاسباتی، NVFP4 از یک استراتژی دو مرحله‌ای هوشمندانه استفاده می‌کند که در آن ابتدا تنسور به دسته‌های ۱۶‌تایی کوچک تقسیم می‌شود تا برای هر کدام یک فاکتور مقیاس‌بندی دقیق از نوع E4M3 در نظر گرفته شود. هم‌زمان، یک لایه مقیاس‌بندی کلی با دقت FP32 نیز روی کل تنسور اعمال می‌گردد؛ این ترکیب دوگانه باعث می‌شود که مدل حتی پس از فشرده‌سازی شدید به ۴ بیت، جزئیات و هوشمندی خود را حفظ کند و خطای محاسباتی به حداقل برسد.

 

 

مقیاس‌بندی با دقت بالا

یکی از برگ‌های برنده NVFP4 در حفظ کیفیت مدل، بهره‌گیری از قابلیتی به نام «مقیاس‌بندی با دقت بالا» است. این فرمت برای رمزگذاری میکروبلوک‌ها از استاندارد E4M3 (در قالب FP8) استفاده می‌کند. تفاوت مهم NVFP4 در این است که برخلاف روش‌های قدیمی که مقیاس‌ها را تنها به توان‌های

 عدد ۲ محدود می‌کردند، این فرمت آزادی عمل دارد تا از فاکتورهای مقیاس‌بندی کسری و غیرتوان‌دو

استفاده کند. این انعطاف‌پذیری باعث می‌شود مدل بتواند توزیع واقعی داده‌های موجود در تنسور را با

دقت بسیار بالاتری شبیه‌سازی کند. نتیجه نهایی این رویکرد هوشمندان که باعث

کاهش چشمگیر خطا و حفظ کیفیت هوشمندی مدل در مقایسه با روش‌های ساده‌تری مانند E8M0 است.

 

 

چرا NVFP4 از نسل‌های قبلی (مانند MXFP4) هوشمندتر عمل می‌کند؟

رمز موفقیت NVFP4 در دو نوآوری فنی نهفته است که اجازه می‌دهد مدل‌های هوش مصنوعی بدون افت دقت، در فرمت ۴ بیتی اجرا شوند:

  • کاهش ابعاد برای تطبیق هوشمند: در نسل‌های قبلی مانند MXFP4، داده‌ها در بلوک‌های ۳۲ تایی گروه‌بندی می‌شدند. اما در NVFP4 ، این گروه به بلوک‌های ۱۶ تایی تقسیم شده است. این کاهش اندازه به سیستم اجازه می‌دهد تا به جای یک مقیاس‌بندی کلی (چتری) برای کل تنسور، بسیار دقیق‌تر و محلی‌تر عمل کند. به زبان ساده، سیستم اکنون می‌تواند اعداد بزرگ و کوچکِ نزدیک به هم را بهتر شناسایی و با دقت متناسب با همان ناحیه، مقیاس‌بندی کند.
  • استفاده از مقیاس‌بندی پویا (Fractional Scaling): برخلاف روش‌های قدیمی که مقیاس‌بندی را تنها به توان‌های عدد ۲ محدود می‌کردند، NVFP4 از دقت E4M3 FP8 استفاده می‌کند. این یعنی فاکتورهای مقیاس می‌توانند دقیق‌تر و کسری باشند که باعث می‌شود «وفاداری» اعدادِ ۴ بیتی به داده‌های اصلی، بسیار بیشتر شود.

در نهایت، هر مقدار ۴ بیتی(xq)  درون یک میکروبلوک، با ضرب شدن در یک فاکتور مقیاس پویا(s)  که به صورت اختصاصی برای همان گروه ۱۶ تایی محاسبه شده، به مقدار دقیق خود بازسازی می‌شود. این «ظرافت در مقیاس‌بندی» همان دلیلی است که باعث می‌شود NVFP4 علی رغم حجم بسیار کم، عملکردی در حد فرمت‌های سنگین‌تر ارائه دهد و هوشمندی مدل را کاملاً حفظ کند.

 

 

جمع بندی

NVFP4 با جایگزینی روش‌های قدیمی و استفاده از «میکروبلوک‌های هوشمند»، توانسته چالش افت دقت در کوانتیزاسیون را به بهترین شکل حل کند؛ نوآوری کلیدی که اجرای مدل‌های عظیم را روی سخت‌افزارها، بسیار سریع‌تر و بهینه‌تر از قبل می‌کند.

در بخش بعد با ما همراه باشید تا عملکرد واقعی این روش و نتایج مدل‌های کوانتایز شده را با هم مشاهده کنیم.

فرمت NVFP4 چیست؟

NVFP4 فرمت ۴ بیتی جدید انویدیا برای افزایش سرعت و کاهش مصرف حافظه مدل‌های هوش مصنوعی است. برخلاف روش‌های قدیمی، این فرمت با استفاده از «میکروبلوک‌های ۱۶‌تایی» و مقیاس‌بندی هوشمند، دقت و هوشمندی مدل را بدون افت حفظ می‌کند.

آیا استفاده از NVFP4 به سخت‌افزار خاصی نیاز دارد؟

این فرمت و شتاب‌دهی سخت‌افزاری مقیاس‌بندی میکروبلوک‌های آن به‌صورت بومی توسط هسته‌های نسل پنجم Tensor Core در معماری پردازنده‌های گرافیکی NVIDIA Blackwell پشتیبانی می‌شود.

آیا NVFP4 اجرای مدل‌های بزرگ را روی دستگاه‌های Edge AI ممکن می‌کند؟

NVFP4 با کاهش چشمگیر مصرف حافظه و افزایش سرعت پردازش، اجرای مدل‌های بزرگ را روی سخت‌افزارهای Edge AI با مصرف انرژی کمتر ممکن می‌سازد.

مشتاقانه منتظر دریافت نظرات شما دوستان عزیز هستیم





مطالب مرتبط

عامل‌های هوش مصنوعی (AI Agents) عامل‌های خودتکامل‌یاب عامل‌های بلندمدت مهار عامل (Harness) محیط اجرای امن (Secure Runtime) عامل‌های تخصصی هوش مصنوعی عامل‌محور (Agentic AI) ماژول برنامه‌ریزی اتصال به ابزارها (Tool Use) خودکارسازی فرایندها

عامل هوش مصنوعی (AI Agent)

what-is-nvfp4-nvidia-blackwell

NVFP4 چیست و چرا انویدیا به ۴ بیت رسید؟

nvidia-jetson-os-jetpack-guide

سیستم‌عامل Jetson

انویدیا DGX Spark رایانه‌های عامل‌محور حافظه یکپارچه سوپرچیپ گریس بلک‌ول کلاستر کردن سیستم‌ها اجرای محلی هوش مصنوعی ابررایانه رومیزی هوش مصنوعی خودمختار اتصال ان‌وی‌لینک (NVLink) بهینه‌سازی مدل‌های زبانی

روایت انویدیا از آینده AI:از DGX-1 تا DGX Spark

`nvidia-jetson-for-edge

چرا NVIDIA Jetson برای Edge AI انتخابی قدرتمند است؟

NVIDIA Isaac Isaac Sim Isaac ROS Isaac Lab NITROS ربات‌های خودران Sim-to-Real داده‌های مصنوعی Edge AI پروژه GR00T

پلتفرم رباتیک NVIDIA Isaac