字節(jié)推出了一種新的大模型,名為 BuboGPT,BuboGPT 是一種先進(jìn)的大型語言模型(LLM),能夠?qū)⑽谋尽D像和音頻等多模態(tài)輸入進(jìn)行整合,并具有將回復(fù)與視覺對象進(jìn)行對接的獨(dú)特能力。它展示了在對齊或未對齊的任意圖像音頻數(shù)據(jù)理解方面的出色對話能力。
通過文字描述、圖像定位和聲音定位,BuboGPT 可以準(zhǔn)確判斷聲音來源,即使音頻和圖像之間沒有直接關(guān)系,也可以合理描述兩者之間的可能關(guān)系。
研究人員表示,相比其他多模態(tài)大模型,BuboGPT 利用文本與其他模態(tài)之間的豐富信息和明確對應(yīng)關(guān)系,提供了對視覺對象及給定模態(tài)的細(xì)粒度理解。
為了實(shí)現(xiàn)多模態(tài)理解,BuboGPT 使用了一個(gè)共享的語義空間,并構(gòu)建了一個(gè)視覺定位 pipeline,其中包括標(biāo)記模塊、定位模塊和實(shí)體匹配模塊。
通過語言作為橋梁,BuboGPT 能夠?qū)⒁曈X對象與其他模態(tài)連接起來。研究人員還展示了 BuboGPT 在圖像描述、聲音來源識別等方面的能力,并開源了代碼和數(shù)據(jù)集,發(fā)布了可玩的 demo。
核心功能:
- 多模態(tài)理解: BuboGPT 實(shí)現(xiàn)了文本、視覺和音頻的聯(lián)合多模態(tài)理解和對話功能。
- 視覺對接: BuboGPT 能夠?qū)⑽谋九c圖像中的特定部分進(jìn)行準(zhǔn)確關(guān)聯(lián),實(shí)現(xiàn)細(xì)粒度的視覺對接。
- 音頻理解: BuboGPT 能夠準(zhǔn)確描述音頻片段中的各個(gè)聲音部分,即使對人類來說一些音頻片段過于短暫難以察覺。
- 對齊和非對齊理解: BuboGPT 能夠處理匹配的音頻 - 圖像對,實(shí)現(xiàn)完美的對齊理解,并能對任意音頻 - 圖像對進(jìn)行高質(zhì)量的響應(yīng)。
文章內(nèi)容僅供閱讀,不構(gòu)成投資建議,請謹(jǐn)慎對待。投資者據(jù)此操作,風(fēng)險(xiǎn)自擔(dān)。
近日,德國柏林國際電子消費(fèi)品展覽會(IFA2024)隆重舉辦。憑借在核心技術(shù)、產(chǎn)品設(shè)計(jì)及應(yīng)用方面的創(chuàng)新變革,全球領(lǐng)先的智能終端企業(yè)TCL實(shí)業(yè)成功斬獲兩項(xiàng)“IFA全球產(chǎn)品設(shè)計(jì)創(chuàng)新大獎(jiǎng)”金獎(jiǎng),有力證明了其在全球市場的強(qiáng)大影響力。
近日,中國家電及消費(fèi)電子博覽會(AWE 2024)隆重開幕。全球領(lǐng)先的智能終端企業(yè)TCL實(shí)業(yè)攜多款創(chuàng)新技術(shù)和新品亮相,以敢為精神勇闖技術(shù)無人區(qū),斬獲四項(xiàng)AWE 2024艾普蘭大獎(jiǎng)。
“以前都要去窗口辦,一套流程下來都要半個(gè)月了,現(xiàn)在方便多了!”打開“重慶公積金”微信小程序,按照提示流程提交相關(guān)材料,僅幾秒鐘,重慶市民曾某的賬戶就打進(jìn)了21600元。
由世界人工智能大會組委會、上海市經(jīng)信委、徐匯區(qū)政府、臨港新片區(qū)管委會共同指導(dǎo),由上海市人工智能行業(yè)協(xié)會聯(lián)合上海人工智能實(shí)驗(yàn)室、上海臨港經(jīng)濟(jì)發(fā)展(集團(tuán))有限公司、開放原子開源基金會主辦的“2024全球開發(fā)者先鋒大會”,將于2024年3月23日至24日舉辦。