دادههای Tether با مدل جدید Vision پارامتر 460M، هوش مصنوعی را از ابر خارج میکند

خوراکی های کلیدی
- واحد QVAC تتر در 29 ژوئیه 2026 یک مدل دید 460 میلیون پارامتری منبع باز ارائه کرد.
- این مدل در 16 تست از 17 تست معیار، رقبای Liquid AI و Hugging Face را شکست داد.
- نسخه Flash آن تا 36 برابر سریعتر از SmolVLM2-500M در آیفون 15 اجرا شد.
روز چهارشنبه توسط بازوی تحقیقاتی هوش مصنوعی این شرکت منتشر شد، QVAC، VisionPsy-Nano می توانند تصاویر، اسناد و نمودارها را بررسی کنند، سپس بدون ارسال منبع منبع به یک سیستم راه دور، به سوالات پاسخ دهند. تلفن هم ورودی و هم پاسخ را کنترل می کند و به نرم افزار اجازه می دهد به صورت آفلاین کار کند و داده ها را روی دستگاه نگه دارد.
QVAC می گوید مدل Tether AI Research بالاترین امتیاز کلی را در بین سیستم های زبان بینایی با کمتر از 500 میلیون پارامتر به ثبت رساند. در 17 معیار، مدل های رقیب را در 16 شکست داد.
چگونه آن را پشته تا
این مدل امتیاز نرمال شده 62.3 را در مقایسه با 59.6 برای LFM2.5-VL-450M Liquid AI و 52.5 برای SmolVLM2-500M Hugging Face به دست آورد. مدل پایه قبلی QVAC nanoVLM-460M-8k امتیاز 54.9 را کسب کرد.
داده های تتر انتشار در دو نسخه ارائه می شود. ساخت استاندارد دقت را در اولویت قرار میدهد، در حالی که Flash مقدار کمی از کیفیت را برای پاسخهای سریعتر کاهش میدهد. QVAC میگوید Flash حدود 99 درصد از عملکرد کامل مدل را حفظ میکند در حالی که اولین خروجی خود را تا 23 برابر سریعتر از SmolVLM2-500M در تلفنهای اندرویدی و تا 36 برابر سریعتر در آیفون 15 تولید میکند.
این زمان پاسخ در سخت افزار موبایل مهم است. یک مدل جمعوجور میتواند در تست امتیاز خوبی کسب کند، اما اگر کاربران باید منتظر بمانند تا دستگاه تصویری را پردازش کند، همچنان غیرعملی به نظر میرسد. فلش برای کاهش تاخیر اولیه طراحی شده است.
سیستم هوش مصنوعی (AI) همچنین از تجزیه و تحلیل اسناد و تشخیص کاراکتر نوری، استخراج متن و ساختار از گزارشهای مالی، فلوچارتها و اینفوگرافیکها پشتیبانی میکند.
QVAC می گوید این مدل در تست های استدلال بصری به طور متوسط 7.4 درصد رقبای هم اندازه را شکست داد. همچنین بیش از دو برابر اندازه خود در MM-IFEval و POPE، از جمله نسخههای Qwen و InternVL، عملکرد بهتری داشت.
چرا ردپای کوچک مهم است
پردازش تصویر متحرک از مرکز داده به تلفن محدودیتهای سختی را در مورد حافظه، گرما، استفاده از باتری و قدرت محاسباتی ایجاد میکند. مدلهای فشرده اغلب متن ساده را مدیریت میکنند، اما هنگام خواندن نمودارهای متراکم، جداول یا اسناد اسکن شده دقت خود را از دست میدهند.
نتایج بنچمارک QVAC نشان میدهد که این مدل بسیاری از این قابلیت را حفظ کرده و در عین حال به اندازه کافی کوچک برای دستگاههای مصرفکننده باقی مانده است. پردازش محلی همچنین به این معنی است که اسناد نیازی به آپلود ندارند و نرم افزار می تواند بدون اتصال به شبکه به کار خود ادامه دهد.
ساخته شده برای چندین گزینه استقرار
توسعه دهندگان می توانند از طریق Hugging Face Transformers، یک نسخه GGUF کوانتیزه شده برای llama.cpp یا یک پشتیبان vLLM برای استفاده از سرور با حجم بالاتر، به مدل دسترسی داشته باشند.
QVAC همچنین پیکربندیهای معیار خود را از طریق VLMEvalKit منتشر کرد و به محققان خارجی اجازه داد آزمایشها را تکرار کنند. هر دو نسخه از مجوز Apache 2.0 استفاده می کنند که اجازه استفاده تجاری، اصلاح و توزیع مجدد را می دهد.
بخشی از استراتژی گسترده تر هوش مصنوعی تتر
پائولو آردوینو، مدیر عامل Tether، گفت که این نسخه از فشار شرکت به سمت سیستمهای هوش مصنوعی محلی و کارآمد پشتیبانی میکند.
آردوینو گفت: «دستیابی به بهترین کیفیت و عملکرد در وظایف بینایی عمومی تنها با 460 میلیون پارامتر ثابت میکند که هوش مصنوعی بسیار کارآمد محلی، مسیری مناسب است.»
این مدل از چندین نسخه QVAC به تاریخ اکتبر 2025 پیروی می کند، از جمله مجموعه داده های آموزشی مصنوعی، کیت توسعه نرم افزار بین پلتفرمی و مدل های پزشکی طراحی شده برای تلفن ها و دستگاه های پوشیدنی.
برای توسعه دهندگان، نسخه تجزیه و تحلیل تصویر آفلاین را بدون هزینه های API مبتنی بر استفاده ارائه می دهد. کسب و کارها می توانند اسناد حساس را روی دستگاه نگه دارند، در حالی که مصرف کنندگان می توانند از ویژگی های هوش مصنوعی بدون سیگنال استفاده کنند. محققان می توانند به طور مستقل ادعاهای عملکرد شرکت را با استفاده از تنظیمات منتشر شده آزمایش کنند.
تتر توسعه هوش مصنوعی خود را با سود کسب و کار استیبل کوین USDT تامین مالی کرده است. همچنین در زیرساختهای هوش مصنوعی، بیوتکنولوژی و رباتیک سرمایهگذاری کرده است، از جمله سرمایهگذاری سری C در NEURA Robotics به ارزش 1.4 میلیارد دلار.

