جذب سرمایه ۵۰ میلیون دلاری Fish Audio؛ مدلهای صوتی هوش مصنوعی در مسیر انقلاب
استارتاپ Fish Audio با مدلهای صوتی متنباز و حرفهای خود، در کمتر از یک سال به بیش از ۸ میلیون کاربر و درآمد سالانه ۲۱ میلیون دلار رسیده و حالا با جذب سرمایه ۵۰ میلیون دلاری به دنبال توسعه بیشتر است.
Fish Audio و خیزش جدید در دنیای صداهای هوش مصنوعی
صنعت تولید صدا با هوش مصنوعی در آستانه یک جهش بزرگ قرار گرفته است. در حالی که سازندگان محتوا به دنبال صداهایی رسا و احساسی هستند، شرکتها نیز برای خودکارسازی پشتیبانی و فروش به مدلهایی فرمانپذیرتر نیاز دارند. استارتاپ Palo Alto-based Fish Audio با کتابخانهای از بیش از ۱۵,۰۰۰ کنترل زبان طبیعی، قصد دارد پاسخگوی تمام این نیازها باشد. این استارتاپ از زمان راهاندازی در سال گذشته، بیش از ۸ میلیون کاربر جذب کرده و درآمد تکرارشونده سالانهای معادل ۲۱ میلیون دلار بدست آورده است.
بر اساس گزارش TechCrunch، Fish Audio در تازهترین دور جذب سرمایه خود موفق به دریافت ۵۰ میلیون دلار در مرحله بذری (Seed) شده است. این دور سرمایهگذاری توسط شرکتهای Coreline Ventures و Capital Today رهبری شد و سرمایهگذارانی مانند 359 Capital، Parable و Play Time نیز در آن مشارکت داشتند. این مبلغ، یکی از بزرگترین سرمایهگذاریهای مرحله بذری در حوزه صداهای هوش مصنوعی محسوب میشود.
ریشههای Fish Audio به یک پروژه کوچک توسط Shijia Liao، محقق سابق NVIDIA بازمیگردد. او که از صدای مصنوعیهای بیروح موجود در بازار ناامید شده بود، یک مدل تولید صدا را تنها با یک واحد پردازش گرافیکی (GPU) آموزش داد و آن را متنباز (Open Source) کرد. مخزن Fish Speech در گیتهاب امروز بیش از ۳۱,۰۰۰ ستاره دارد و توسط توسعهدهندگان مستقل، طراحان بازیهای ویدئویی و سازندگان محتوا استفاده میشود.
این استارتاپ در یک سال گذشته پنج مدل عرضه کرده است: چهار مدل تولید گفتار و یک مدل گفتار به متن. سه مدل از این چهار مدل گفتار، متنباز هستند، اما جدیدترین مدل آنها یعنی S2.1 Pro تنها از طریق API پولی در دسترس است.
Fish Audio طرحهای اشتراک ماهانهای برای سازندگان و تیمها ارائه میدهد که تعداد مشخصی دقیقه تولید صدا و قابلیتهای کلونسازی صدا را شامل میشوند. این شرکت همچنین نسخه سازمانی (Enterprise) از پلتفرم خود را در اختیار شرکتهایی مانند HeyGen، Sanas و Plaud قرار داده است. Rissa Cao، مدیرعامل Fish Audio به TechCrunch گفت: "هر سازمانی کاربردها و اولویتهای متفاوتی دارد. برای مثال، شرکتهایی مثل HeyGen که از صداها برای آواتارهای هوش مصنوعی استفاده میکنند، واقعگرایی میخواهند؛ یک استودیوی بازی به صدایی احساسی برای شخصیتها نیاز دارد؛ و شرکتهای عامل صوتی مثل LiveKit صدایی طبیعی و با تأخیر کم میخواهند که برای تماسها به اندازه کافی گویا باشد."
یکی از راههای Fish Audio برای ساخت کتابخانه صدا، درخواست از کاربران برای آپلود صدای خودشان و دریافت پاداش در صورت استفاده از آن بوده است. اما این رویکرد چند ماه پیش دردسرساز شد؛ برخی سازندگان ادعا کردند که صدایشان بدون رضایت در پلتفرم Fish Audio بارگذاری شده است. این استارتاپ فرآیندی برای حذف محتوا بر اساس قانون DMCA داشت، اما فرآیند حذف زمان زیادی میبرد. Cao میگوید اکنون این فرآیند خودکار شده و سازندگان میتوانند با ارسال یک نمونه صدای کوتاه یا قرارداد، اثبات کنند که صدا متعلق به آنهاست و در کمتر از ۳ دقیقه صدا از پلتفرم حذف شود. با این حال، این مکانیزم از آپلود مخفیانه صدای یک هنرمند جلوگیری نمیکند و تا زمانی که هنرمند مطلع نشده و درخواست حذف ندهد، صدایش در پلتفرم باقی میماند.
Oskue Honda، شریک Coreline Ventures، معتقد است که یک مدل مبتنی بر جامعه فقط زمانی مزیتی پایدار است که سازندگان به پلتفرم اعتماد داشته باشند. او گفت: "رویکرد جامعهمحور تنها زمانی میتواند به مزیتی پایدار تبدیل شود که سازندگان به پلتفرم اعتماد کنند. این یعنی رضایت، شفافیت و نسبتدهی باید در خود محصول تعبیه شوند، نه اینکه به عنوان فکرهای بعدی به آن اضافه شوند. به باور من صنعت باید به سمت مالکیت تأییدشده صدا، شرایط مجوز شفاف، فرآیندهای آسان گزارش و حذف و در نهایت مدلهای تقسیم درآمد پیش برود که در آن سازندگان وقتی صدایشان مجوز گرفته یا تجاری میشود، از نظر مالی بهرهمند شوند."
Cao توضیح داد زمانی که استارتاپ تنها محصول خود را به صورت متنباز و با برنامههایی برای سازندگان عرضه میکرد، بهخوبی مدیریت میشد و نیازی به سرمایه نداشت. اما برای توسعه مدلهای پیشرفتهتر و پاسخ به تقاضای سازمانها و افزایش علاقه سرمایهگذاران، جذب سرمایه را ضروری دید. Fish Audio امسال همچنین قصد دارد یک مدل درک صوت و یک مدل گفتار به گفتار منتشر کند.
بازار تولید گفتار رقابتی است و شرکتهایی مانند ElevenLabs، WellSaid، Cartesia، Speechify و Krisp برای جلب نظر سازندگان و سازمانها رقابت میکنند. به گفته Rico Mallozzi، شریک 359 Capital، کنترلهای دقیق برای توسعهدهندگان و آموزش مدل با هزینه مقرونبهصرفه به Fish Audio کمک میکند تا با آزمایشگاههای بزرگ هوش مصنوعی رقابت کند. او در گفتوگو با TechCrunch گفت: "فکر میکنم چیزی که آنها توانستهاند بسازند، یعنی مدلهای پیشرفته، با تیمی که دارند، در مقایسه با برخی از این آزمایشگاههای هوش مصنوعی پرمایه، فوقالعاده است. این نشاندهنده دانش فنی آنها در پرکردن شکاف بین صدای مصنوعی و صدای انسانمانند است."
این سرمایهگذاری قابل توجه نشان میدهد که بازار مدلهای صوتی هوش مصنوعی هنوز در مراحل اولیه رشد است و فرصتهای زیادی برای نوآوری و رقابت وجود دارد. برای کاربران ایرانی که به دنبال استفاده از فناوریهای پیشرفته صوتی هستند، مدلهای متنباز Fish Audio میتواند گزینهای قابل توجه باشد، هرچند محدودیتهای دسترسی به APIهای پولی ممکن است چالشبرانگیز باشد.