استارتاپ ElevenLabs دو مدل گفتاری جدید با نامهای ElevenLabs v4 و v4 Turbo معرفی کرده است. در این مدلهای صوتی جدید، قابلیتهای کنترل بیان و احساسات گسترش پیدا کردهاند، تأخیر زمانی مربوط به ایجنتهای صوتی (Voice Agents) بهطرز چشمگیری کاهش پیدا کرده و امکان پشتیبانی از بیش از ۹۰ زبان مختلف را فراهم میکنند.
ElevenLabs برای توسعه نسل مدلهای v4 از معماری جدیدی بهره گرفته است که امکان کنترل بهتر و شبیهسازی سریعتر صدا را فراهم میکند. براساس اعلام این شرکت، کاربران در مدل صوتی v4 میتوانند تنها با استفاده از ۱۰ ثانیه فایل صوتی، یک صدا را بهطور کامل شبیهسازی یا کلون کنند.
ارتقای مدل صوتی ElevenLabs v4 برای کاربردهای خلاقانه و سازمانی
از دیدگاه خلاقانه، مدل جدید هویت صدا را در قطعات متنی طولانیتر بسیار بهتر حفظ میکند. این سیستم همچنین هنگام خواندن متن با صدای بلند، زمینه و مفهوم متن را در نظر میگیرد تا حالتها و احساسات بیانی خود را متناسب با آن تغییر دهد. شرکت ElevenLabs همراه با مدل v3 برچسبهای درونمتنی را برای تعیین لحن و بیان معرفی کرده بود و اکنون در نسخه v4 این تگها را گسترش داده است؛ بهطوریکه کاربران میتوانند چندین تگ بیانی را پشت سر هم قرار دهند تا مدل دقیقاً توالی آنها را دنبال کند.
بر اساس آزمون مقایسهای انجامشده میان کاربران، مدل جدید ElevenLabs v4 از نظر میزان بیان احساسات و لحن طبیعی برتری محسوسی نسبت به رقبای سرشناس بازار کسب کرده است. در این ارزیابی، مدل v4 توانسته در برابر Cartesia Sonic 3.6 و Inworld TTS-2 با کسب ۸۱ درصد ترجیح کاربران در هر کدام به پیروزی دست یابد؛ همچنین در رقابت با مدلهای تبدیل متن به گفتار گوگل، ۶۵ درصد ترجیح کاربران را در برابر Google Gemini 3.8 Flash TTS و ۷۲ درصد ترجیح را در مقایسه با نسخه Google Gemini 3.8 Flash-Lite TTS از آن خود کرده است.
![ElevenLabs از مدلهای صوتی جدید v4 با پشتیبانی از ۹۰ زبان رونمایی کرد [تماشا کنید] ElevenLabs از مدلهای صوتی جدید v4 با پشتیبانی از ۹۰ زبان رونمایی کرد [تماشا کنید]](https://static.digiato.com/digiato/2026/09/V4-benchmark.jpg.webp)
نسخه قبلی از ۷۰ زبان پشتیبانی میکرد، اما در مدل جدید این عدد به بیش از ۹۰ زبان رسیده است. این شرکت اعلام کرده که بیشترین رشد کیفی در زبانهای ژاپنی، پرتغالی برزیلی، ماندارین و کانتونی مشاهده شده است. بخش تماسهای سازمانی ElevenLabs در طول سال گذشته رشد سریعی را تجربه کرده و بیش از ۵۵ درصد از تجارت آن به شرکتهای بزرگ اختصاص یافته است. این استارتاپ تأکید دارد که نسخه v4 گزینهای بسیار مناسب برای ایجنتهای صوتی است، زیرا تأخیر کمتری دارد و گفتوگوهای روانتری را شکل میدهد.
علاوهبراین، مدل v4 میتواند بهمحض شروع تولید پاسخ توسط مدل زبانی بزرگ متصل به آن، فرایند تبدیل پاسخ به صوت را آغاز کند. همچنین، این سیستم توانایی مدیریت برخوردهای کلامی، تنشها و زمانهای انتظار را برای حل بهتر مشکلات در تماسها دارد.
رقابت در حوزه مدلهای گفتاری با حضور استارتاپهایی نظیر Cartesia ،Deepgram ،Fish Audio ،Boson و WellSaid Labs که همگی مدلهای صوتی با قابلیت انتقال احساسات توسعه دادهاند، شدت پیدا کرده است. از سوی دیگر، غولهای فناوری نظیر گوگل و OpenAI نیز مدلهای صوتی خود را ارتقا دادهاند. استارتاپ ElevenLabs اوایل امسال موفق به جذب سرمایه ۵۰۰ میلیون دلاری از شرکت Sequoia با ارزشگذاری ۱۱ میلیارد دلار شد. همچنین شایعاتی درباره دور بعدی جذب سرمایه با ارزشگذاری ۲۲ میلیارد دلاری مطرح شده است. درآمد سالانه شرکت نیز از حدود ۳۳۰ میلیون دلار در ابتدای سال به بیش از ۶۰۰ میلیون دلار افزایش پیدا کرده است.
