Artwork

محتوای ارائه شده توسط Kabir. تمام محتوای پادکست شامل قسمت‌ها، گرافیک‌ها و توضیحات پادکست مستقیماً توسط Kabir یا شریک پلتفرم پادکست آن‌ها آپلود و ارائه می‌شوند. اگر فکر می‌کنید شخصی بدون اجازه شما از اثر دارای حق نسخه‌برداری شما استفاده می‌کند، می‌توانید روندی که در اینجا شرح داده شده است را دنبال کنید.https://fa.player.fm/legal
Player FM - برنامه پادکست
با برنامه Player FM !

🗣️ Dia: New Open Source Text-to-Speech Model

11:31
 
اشتراک گذاری
 

Manage episode 478813485 series 3605659
محتوای ارائه شده توسط Kabir. تمام محتوای پادکست شامل قسمت‌ها، گرافیک‌ها و توضیحات پادکست مستقیماً توسط Kabir یا شریک پلتفرم پادکست آن‌ها آپلود و ارائه می‌شوند. اگر فکر می‌کنید شخصی بدون اجازه شما از اثر دارای حق نسخه‌برداری شما استفاده می‌کند، می‌توانید روندی که در اینجا شرح داده شده است را دنبال کنید.https://fa.player.fm/legal

Nari Labs, a two-person startup, has launched Dia, an open-source text-to-speech model. This model, boasting 1.6 billion parameters, is designed to generate natural-sounding dialogue from text, even incorporating emotional tones and nonverbal cues. Its creators claim Dia surpasses existing proprietary models from companies like ElevenLabs and Google in terms of quality and nuanced control. The model's code and weights are freely available, allowing developers to download and deploy it locally. Dia supports features such as speaker tagging and the interpretation of nonverbal cues within the text prompts, offering more customizable speech generation. Nari Labs provides comparison examples highlighting Dia's superior performance in dialogue scenarios, emotional delivery, handling of nonverbal cues, and even rhythmic content like rap lyrics. Distributed under an Apache 2.0 license, Dia is intended for various applications, from content creation to assistive technologies, with a focus on ethical use and community collaboration.

Send us a text

Support the show

Podcast:
https://kabir.buzzsprout.com
YouTube:
https://www.youtube.com/@kabirtechdives
Please subscribe and share.

  continue reading

282 قسمت

Artwork
iconاشتراک گذاری
 
Manage episode 478813485 series 3605659
محتوای ارائه شده توسط Kabir. تمام محتوای پادکست شامل قسمت‌ها، گرافیک‌ها و توضیحات پادکست مستقیماً توسط Kabir یا شریک پلتفرم پادکست آن‌ها آپلود و ارائه می‌شوند. اگر فکر می‌کنید شخصی بدون اجازه شما از اثر دارای حق نسخه‌برداری شما استفاده می‌کند، می‌توانید روندی که در اینجا شرح داده شده است را دنبال کنید.https://fa.player.fm/legal

Nari Labs, a two-person startup, has launched Dia, an open-source text-to-speech model. This model, boasting 1.6 billion parameters, is designed to generate natural-sounding dialogue from text, even incorporating emotional tones and nonverbal cues. Its creators claim Dia surpasses existing proprietary models from companies like ElevenLabs and Google in terms of quality and nuanced control. The model's code and weights are freely available, allowing developers to download and deploy it locally. Dia supports features such as speaker tagging and the interpretation of nonverbal cues within the text prompts, offering more customizable speech generation. Nari Labs provides comparison examples highlighting Dia's superior performance in dialogue scenarios, emotional delivery, handling of nonverbal cues, and even rhythmic content like rap lyrics. Distributed under an Apache 2.0 license, Dia is intended for various applications, from content creation to assistive technologies, with a focus on ethical use and community collaboration.

Send us a text

Support the show

Podcast:
https://kabir.buzzsprout.com
YouTube:
https://www.youtube.com/@kabirtechdives
Please subscribe and share.

  continue reading

282 قسمت

كل الحلقات

×
 
Loading …

به Player FM خوش آمدید!

Player FM در سراسر وب را برای یافتن پادکست های با کیفیت اسکن می کند تا همین الان لذت ببرید. این بهترین برنامه ی پادکست است که در اندروید، آیفون و وب کار می کند. ثبت نام کنید تا اشتراک های شما در بین دستگاه های مختلف همگام سازی شود.

 

راهنمای مرجع سریع

در حین کاوش به این نمایش گوش دهید
پخش