فیش آدیو با جذب ۵۰ میلیون دلار سرمایه بذری، انقلاب صداهای هوش مصنوعی را شتاب میبخشد
استارتاپ فیش آدیو با جذب سرمایه ۵۰ میلیون دلاری و بیش از ۸ میلیون کاربر، قصد دارد مدلهای صوتی هوش مصنوعی را برای تولیدکنندگان محتوا و شرکتها متحول کند. این فناوری میتواند بازار دوبله، بازیسازی و خدمات مشتریان در ایران را دگرگون سازد.
جهان هوش مصنوعی این روزها شاهد تحولی چشمگیر در حوزه تولید صداهای مصنوعی است و استارتاپ فیش آدیو (Fish Audio) با یک سرمایهگذاری بذری ۵۰ میلیون دلاری، جایگاه خود را بهعنوان یکی از بازیگران اصلی این عرصه تثبیت کرده است. این خبر که بهتازگی توسط تککرانچ (TechCrunch) گزارش شده، نشان میدهد بازار مدلهای صوتی هوش مصنوعی تا چه اندازه داغ و رقابتی شده است.
فیش آدیو که مقر آن در پالو آلتو قرار دارد، با کتابخانهای از بیش از ۱۵ هزار کنترل زبان طبیعی (natural language controls) به کاربران امکان میدهد صداهایی بسیار طبیعی و احساسی خلق کنند. این استارتاپ از زمان راهاندازی در سال گذشته، بیش از ۸ میلیون کاربر جذب کرده و اکنون درآمد تکرارشونده سالانهای معادل ۲۱ میلیون دلار دارد.
از یک پروژه کوچک تا میلیونها کاربر
داستان فیش آدیو با پروژهای شخصی توسط شیجی لیائو (Shijia Liao)، محقق سابق انویدیا (NVIDIA) آغاز شد. او که از صداهای مصنوعی بیروح موجود در بازار خسته شده بود، یک مدل مولد صدا (voice generation model) را روی یک پردازنده گرافیکی (GPU) آموزش داد و آن را بهصورت متنباز (open-source) در اختیار عموم قرار داد. مخزن Fish Speech در گیتهاب اکنون بیش از ۳۱ هزار ستاره دارد و توسط توسعهدهندگان مستقل، طراحان بازیهای ویدئویی و تولیدکنندگان محتوا استفاده میشود.
این استارتاپ در سال گذشته پنج مدل عرضه کرده: چهار مدل تولید صدا و یک مدل تبدیل گفتار به متن. سه مدل از این میان متنباز هستند، اما جدیدترین مدل یعنی S2.1 Pro تنها از طریق API پولی در دسترس است. فیش آدیو طرحهای اشتراک ماهانهای برای تولیدکنندگان محتوا و تیمها ارائه میدهد که شامل تعداد مشخصی دقیقه تولید صدا و قابلیت شبیهسازی صدا (voice cloning) است. نسخه سازمانی این پلتفرم نیز شرکتهایی مانند HeyGen، Sanas و Plaud را به مشتریان خود تبدیل کرده است.
چالشها و اعتماد جامعه کاربری
یکی از راههای جالب فیش آدیو برای ساخت کتابخانه صدا، درخواست از کاربران برای بارگذاری صدای خود و دریافت پاداش در صورت استفاده از آن است. اما همین رویکرد چند ماه پیش جنجال آفرید؛ زمانی که برخی هنرمندان متوجه شدند صدایشان بدون رضایت روی این پلتفرم بارگذاری شده است. اگرچه فرایند حذف محتوا بر اساس قانون کپیرایت هزاره دیجیتال (DMCA) وجود داشت، اما کندی آن انتقادهایی را برانگیخت.
ریسا کائو (Rissa Cao)، مدیرعامل و همبنیانگذار فیش آدیو، به تککرانچ گفت که اکنون فرایند حذف خودکار شده است. تولیدکنندگان محتوا میتوانند با ارسال یک نمونه صدای کوتاه یا قرارداد، مالکیت خود را ثابت کنند و ظرف کمتر از ۳ دقیقه صدایشان از پلتفرم حذف شود. با این حال، این رویه جلوی بارگذاری اولیه بدون اجازه را نمیگیرد و تا زمانی که هنرمند متوجه نشود، صدایش قابل استفاده باقی میماند.
اوسکوئه هوندا (Oskue Honda)، شریک Coreline Ventures (یکی از سرمایهگذاران اصلی این دور)، تأکید میکند که رویکرد جامعهمحور تنها زمانی مزیت پایدار ایجاد میکند که تولیدکنندگان به پلتفرم اعتماد داشته باشند. به گفته او، «رضایت، شفافیت و نسبتدهی (attribution) باید در محصول نهادینه شود، نه اینکه بهعنوان یک فکر ثانویه به آن اضافه گردد.»
آینده و رقابت تنگاتنگ
کائو میگوید تا پیش از این، فیش آدیو بهعنوان یک پروژه متنباز با طرحهای ویژه تولیدکنندگان محتوا، کارآمد و بینیاز از سرمایه خارجی بود. اما برای ساخت مدلهای پیشرفتهتر و پاسخ به تقاضای سازمانها، جذب سرمایه منطقی شد. اکنون این استارتاپ در نظر دارد امسال یک مدل درک صوتی (audio understanding model) و همچنین یک مدل گفتار به گفتار (speech-to-speech) عرضه کند.
بازار تولید صدای هوش مصنوعی بسیار شلوغ است و رقبایی مانند ElevenLabs، WellSaid، Cartesia و Krisp نیز در آن فعالند. اما سرمایهگذاران معتقدند کنترلهای دقیق برای توسعهدهندگان و آموزش مقرونبهصرفه مدلها، برگ برنده فیش آدیو در رقابت با آزمایشگاههای بزرگ هوش مصنوعی خواهد بود.
پیامدها برای ایران
برای کاربران و کسبوکارهای ایرانی، پیشرفتهایی مانند فیش آدیو دریچهای تازه میگشاید. مدلهای متنباز این استارتاپ میتوانند توسط توسعهدهندگان ایرانی برای ساخت ابزارهای بومی دوبله، تولید کتابهای صوتی، یا شخصیتهای بازیهای ویدئویی به کار روند. شرکتهای داخلی نیز میتوانند با استفاده از نسخه سازمانی، خدمات پشتیبانی مشتریان خود را با صداهای طبیعی و کمتأخیر خودکار کنند. با این وجود، چالشهایی مانند کیفیت صداهای فارسی، نیاز به دادههای آموزشی بومی، و مسائل حقوقی مربوط به مالکیت صدا باید جدی گرفته شوند. در مجموع، فیش آدیو نمونهای از شتاب بیسابقه در حوزه هوش مصنوعی است که میتواند فرصتهای بینظیری برای خلاقان ایرانی رقم بزند.