من یک آواتار دیجیتال تعاملی از خودم ایجاد کردم – و شما می توانید با آن صحبت کنید

هنگامی که الکساندر وویکا، رئیس امور شرکتی در استارتاپ نسل ویدیویی Synthesia، در تابستان امسال پیوندی به جدیدترین عضو تیم روابط عمومی آنها برای من فرستاد، شگفت زده شدم. یک بود آواتار مجازی تعاملی او، آموزش دیده برای پاسخ به سوالات رایج مطبوعات در مورد Synthesia، مانند آنچه که انجام می دهد و چگونه کار می کند. روز قبل، من در یک پانل بودم که در آن افراد روابط عمومی از من پرسیدند که آیا به طرحهایی که از متن تولید شده توسط هوش مصنوعی استفاده میکردند، اهمیت نمیدهم. اما آواتار الکساندرو فراتر از این بود – به نظر من این آخرین رئیس استفاده از هوش مصنوعی در روابط عمومی بود.
در ماه سپتامبر، Synthesia من را به فضای اداری جدید خود در نیویورک دعوت کرد. Synthesia که در ابتدا در انگلستان مستقر است، یک استارت آپ آواتار دیجیتال داغ در کنار سایرین مانند D-ID، HeyGen و Colossyan است. اوایل سال جاری به ارزش 4 میلیارد دلار رسید و سال گذشته اعلام کرد که از آن عبور کرده است 100 میلیون دلار ARR.
Synthesia به شرکتها اجازه میدهد ویدیوهای آموزشی تعاملی با آواتارهای هوش مصنوعی بسازند و اخیراً محصولی به نام Roleplay Sessions راهاندازی کرده است که به کارمندان اجازه میدهد به عنوان مثال، فروشها را با یک آواتار هوش مصنوعی تعاملی که پاسخ میدهد و به پاسخهای آنها امتیاز میدهد، تمرین کنند.
وقتی به افتتاحیه دفتر جدید رفتم و از من پرسیدند که آیا آواتار هوش مصنوعی خودم را دوست دارم، حتی در پاسخ به این سوال تردید نکردم. البته من دوقلو دیجیتال خودم را دوست دارم. آن روز لباس من زیبا بود و موهایم سر جایش بود.
تا زمانی که دوقلوهای دیجیتال خود را ملاقات نکردم، نسبت به آواتارها بی تفاوت بودم، اما احساس می کردم که آنها به ناچار بخشی از زندگی روزمره آنلاین خواهند شد. من از افرادی در اینستاگرام شنیدم که آنها را به شکلی شبیه خود ساخته اند تا به آنها در تولید محتوای اجتماعی کمک کنند. به نظر من همه چیز بسیار جالب است، و شاید به همین دلیل است که اکنون هیچ ابایی ندارم که دوقلو دیجیتال خود را به شما ارائه دهم. این اولین بار است که Synethsia یک آواتار دیجیتال برای یک روزنامه نگار (یا برای هر کسی، نقطه، خارج از Voica) می سازد. این در مورد داستان من در مورد اینکه چرا استارتآپهای دارای پشتوانه سرمایهگذاری بیشتر از استارتآپهای بدون پشتوانه VC مرتکب تقلب میشوند آموزش داده شده است. فقط به سوالات پاسخ خواهد داد در مورد آن داستان
در زیر، برای شروع به سادگی “شروع در یک پنجره جدید” را فشار دهید.
می توانید سوالاتی از این قبیل بپرسید:
- چرا تصمیم گرفتم این داستان را بنویسم؟
- مقاله پژوهشی در مورد چیست؟
- محققین چه چیزی پیدا کردند؟
برای ساختن این کار، وارد یک استودیوی مینی فیلم شدم که در دفتر سینتسیا قرار داشت و در آنجا عکسهای زیادی از من گرفتند و یک ضبط دو دقیقهای از صدای من گرفتند. من باید رضایت می دادم که این آواتارها ساخته شوند و خب، دیجیتال Dom متولد شد. آنها یک آواتار شخصی برای من ساختند (یکی که هر اسکریپت را که می دهم می خواند) – با و بدون عینک – و دو آواتار تعاملی برای من ساختند (آنهایی که می توانند به من صحبت کنند و به من گوش دهند)، همچنین با و بدون عینک.
ما مقاله ای را برای آموزش آواتار تعاملی و سپس یکی از تیم ها انتخاب کردیم آواتار تعاملی من را ساختکه با ترکیبی از مدل های تبدیل صدا به متن، ویدئو، زبان و متن به صدا ارائه می شود. مجموعه فناوری آواتار من شامل مدلهای ویدیویی و صوتی خود Synthesia است، اگرچه این شرکت همچنین به مشتریان اجازه میدهد تا از آزمایشگاههای دیگر مانند Cartesia، ElevenLabs، Google یا OpenAI گزینههای جایگزین را انتخاب کنند. شرکتها همچنین میتوانند آواتارهای خود را در هر فضای ابری که میخواهند میزبانی کنند یا برای میزبانی آنها به Synthesia پرداخت کنند.
مدل صدا به متن آنچه مردم می گویند را به متن تبدیل می کند، مدل زبان عاملی متن را معنا می کند و می تواند بر اساس آن اقداماتی انجام دهد، مدل متن به صدا پاسخ را به صدا تبدیل می کند و در نهایت یک مدل ویدیویی (ساخته شده توسط Synthesia) آواتار را در حین صحبت متحرک می کند.
به طور کلی، Synthesia می سازد سه نوع محصول – یک پلتفرم ایجاد و توزیع ویدیو با آواتارهای کلاسیک، که در آن شخصی یک اسکریپت را تایپ می کند و آواتار آن را تکرار می کند. یک پلتفرم عاملی به نام Sessions که در آن افراد می توانند با آواتارها در نظرسنجی یا نقش آفرینی؛ و یک پلتفرم API که در آن افراد میتوانند مدلهای ویدیویی و صوتی Synthesia را بگیرند و آنها را با سایر خدمات فناوری ترکیب کنند تا آواتارهای تعاملی یا انواع دیگر محصولات بسازند.
تیم Synthesia چند روز طول کشید تا آواتارهای من را بسازند. من ابتدا با افراد شخصی بازی کردم و یک اسکریپت نسبتاً عمومی را تایپ کردم تا ببینم صدای هوش مصنوعی من چگونه است. من در مورد چگونگی ورود پاییز به نیویورک، زمان مورد علاقه من از سال صحبت کردم. صدا نسبتاً دقیق بود، و خوشحالم که هیچ یک از گرفتگی صدا را که هنگام ضبط نمونه صوتی خود داشتم، دریافت نکرد.
من آن را به برخی از دوستان غیر فنی نشان دادم که آن را هم جالب و هم ترسناک یافتند.
سپس من تعاملی خود را به آنها نشان دادم که قطعی است، به این معنی که فقط آنچه را که برای پاسخ دادن به آن آموزش دیده بود می گوید. در این مورد، این داستان کلاهبرداری سرمایه گذاری من بود. من از او سؤالاتی پرسیدم مانند اینکه قبل از TechCrunch کجا بودم و در کدام بخش از نیویورک زندگی می کردم، اما هر بار مرا به داستان هدایت می کرد.
دوستان من فکر نمیکردند که صدا خیلی شبیه صدای من باشد و فکر میکردند که شبیه به آواتار شخصی نیست، اما با این وجود آنقدر نزدیک بود که تا حدودی ترسناک باشد. مادرم آن را «شگفتانگیز» نامید که بسیار مورد تحسین اوست. او و پدرم سعی میکردند از آن سؤالاتی بپرسند که «فقط آنها میدانند» در مورد من – اما مدل پاسخی نداد و هر بار آنها را به داستان کلاهبرداری مخاطرهآمیز هدایت میکرد.
او پس از آزمایش مدل به شوخی گفت: “من به یاد ندارم که شما دو نفر را به دنیا آورده باشم.”
این تجربه باعث شد به این فکر کنم که آینده روزنامه نگاری چه می تواند باشد. آیا مردم با روشن کردن اخبار و ارائه آن توسط یک آواتار موافق هستند؟ یکی از سرمایه گذاران بلافاصله به من گفت نه. مطمئناً امروزه فشارهای زیادی در زمینه هوش مصنوعی وجود دارد که در رسانههای اجتماعی و دیگر پلتفرمهای اشتراکگذاری اخبار نفوذ کرده است. اما دیگرانی که پرسیدم چندان مطمئن نبودند. آیا آواتارها می توانند روزنامه نگاران را تقویت کنند یا حتی جایگزین کنند؟ آیا مدیران عامل می خواهند با آواتار هوش مصنوعی یک روزنامه نگار صحبت کنند تا یک انسان؟
چیزی که در مورد شغلم دوست دارم ارتباط با مردم، نوشتن داستان و تحقیق در مورد موضوعات جدید است. اما بزرگترین بخش روزنامه نگاری اعتماد است. به نظر نمی رسد که هرگز بتوان آن را به یک هوش مصنوعی برون سپاری کرد.
خارج از روزنامه نگاری، من مطمئن هستم که ایده شبیه سازی خود می تواند جذاب باشد. پس از تعطیلات یا تعطیلات دیگر نیازی به پیگیری کار نیست، زیرا نسخه ای از شما همیشه می تواند در اطراف باشد و به سوالات پاسخ دهد.
ما باید ببینیم که چگونه استفاده از آواتار در آمریکای شرکتی تکامل مییابد. اما حالا که خودم را دارم، احساسات متفاوتی دارم. بعد از اینکه به تازگی اولیه آن غلبه کردم، آواتار خود را از نزدیک بررسی کردم، بعد از اینکه صحبت نکرد و منتظر ماندم – مطمئن نیستم. شاید منتظر چشمک زدنش هستم. یا اینکه چیزی جدید بگی، یا لبخند بزنی، یا فقط به من خبر بدهی می داند.
از آنجا که دوقلوهای دیجیتال من جبرگرا هستند، هرگز این کار را نمی کنند. اما میتوانم ببینم که چقدر آسان است که فردی با روانپریشی هوش مصنوعی با روانپریشی غیرقطعی، به این معنی که توسط یک ربات چت که آزادانه میتوان به عنوان پاپ میخواند، راهاندازی کرد، گرفتار شود.
به یکی از سرمایهگذاران گفتم که آینده دوقلوهای دیجیتال هر چه باشد، پیشبینی میکنم که نسل من، Gen Z، احتمالاً به آنها عادت نخواهد کرد. آنها احساس علمی تخیلی میکنند: هر چیزی که تا به حال در یک فیلم دیدهایم اکنون اینجاست. اما میگویم، آواتارهای دیجیتالی را کمتر از انساننماها آزاردهنده میدانم. حداقل با یک آواتار، اگر چیزها عجیب و غریب شوند، همیشه می توانم از سیستم خارج شوم.
با این حال، تا آن زمان، اینجا آواتار شخصی من است که خلاصه ای از تمام داستان های برتر سایت ما را در این هفته به شما ارائه می دهد!
وقتی از طریق پیوندهای موجود در مقالات ما خرید می کنید، ممکن است کمیسیون کمی کسب کنیم. این بر استقلال تحریریه ما تأثیر نمی گذارد.

