Meta 大模型Llama 3 發(fā)布-廣東鋒范科技有限公司

Meta 大模型Llama 3 發(fā)布

2024.04.20

當(dāng)?shù)貢r(shí)間4月18日，Meta在官網(wǎng)上宣布公布了旗下最新大模型Llama 3。目前，Llama 3已經(jīng)開(kāi)放了80億（8B）和700億（70B）兩個(gè)小參數(shù)版本，上下文窗口為8k。Meta表示，通過(guò)使用更高質(zhì)量的訓(xùn)練數(shù)據(jù)和指令微調(diào)，Llama 3比前代Llama 2有了“顯著提升”。

未來(lái)，Meta將推出Llama 3的更大參數(shù)版本，其將擁有超過(guò)4000億參數(shù)。Meta也將在后續(xù)為L(zhǎng)lama 3推出多模態(tài)等新功能，包括更長(zhǎng)的上下文窗口，以及Llama 3研究論文。

Meta在公告中寫(xiě)道：“通過(guò)Llama 3，我們致力于構(gòu)建能夠與當(dāng)今最優(yōu)秀的專(zhuān)有模型相媲美的開(kāi)源模型。我們想處理開(kāi)發(fā)者的反饋，提高Llama 3 的整體實(shí)用性，同時(shí)，繼續(xù)在負(fù)責(zé)地使用和部署LLM（大型語(yǔ)言模型）方面發(fā)揮領(lǐng)先作用?！?/p>

18日當(dāng)天，Meta股價(jià)（Nasdaq：META）收于每股501.80美元，漲1.54%，總市值1.28萬(wàn)億美元。

“目前市場(chǎng)上最好的開(kāi)源大模型”

據(jù)Meta介紹，Llama 3已經(jīng)在多種行業(yè)基準(zhǔn)測(cè)試上展現(xiàn)了最先進(jìn)的性能，提供了包括改進(jìn)的推理能力在內(nèi)的新功能，是目前市場(chǎng)上最好的開(kāi)源大模型。

在架構(gòu)層面，Llama3選擇了標(biāo)準(zhǔn)的僅解碼（decoder-only）式Transformer架構(gòu)，采用包含128K token詞匯表的分詞器。Llama 3在Meta自制的兩個(gè)24K GPU集群上進(jìn)行預(yù)訓(xùn)練，使用了超過(guò)15T的公開(kāi)數(shù)據(jù)，其中5%為非英文數(shù)據(jù)，涵蓋30多種語(yǔ)言，訓(xùn)練數(shù)據(jù)量是前代Llama 2的七倍，包含的代碼數(shù)量是Llama 2的四倍。

根據(jù)Meta的測(cè)試結(jié)果，Llama 3 8B模型在MMLU、GPQA、HumanEval等多項(xiàng)性能基準(zhǔn)上均超過(guò)了Gemma 7B和Mistral 7B Instruct，70B模型則超越了名聲在外的閉源模型Claude 3的中間版本Sonnet，和谷歌的Gemini Pro 1.5相比三勝兩負(fù)。

Llama 3在多項(xiàng)性能基準(zhǔn)上表現(xiàn)出眾。來(lái)源：Meta官網(wǎng)

在常規(guī)數(shù)據(jù)集之外，Meta還致力于優(yōu)化Llama 3在實(shí)際場(chǎng)景中的性能，為此專(zhuān)門(mén)研發(fā)了一套高質(zhì)量的人工測(cè)試集。該測(cè)試集包含1800條數(shù)據(jù)，涵蓋了尋求建議、封閉式問(wèn)題回答、頭腦風(fēng)暴、編碼、寫(xiě)作等12個(gè)關(guān)鍵用例，并對(duì)開(kāi)發(fā)團(tuán)隊(duì)保密。

在這套測(cè)試集中，從結(jié)果來(lái)看，Llama 3的成績(jī)大幅超越了Llama 2，也勝過(guò)了Claude 3 Sonnet、Mistral Medium和GPT-3.5這些知名模型。

Llama 3在人工測(cè)試集上取得優(yōu)異成績(jī)。來(lái)源：Meta官網(wǎng)

而Llama 3的400B+模型雖然仍在訓(xùn)練中，Meta也展現(xiàn)了其部分測(cè)試成果，似乎旨在對(duì)標(biāo)Claude 3的最強(qiáng)版本Opus。不過(guò)，Meta沒(méi)有公布Llama 3更大參數(shù)模型和GPT-4等同規(guī)格選手的對(duì)比成果。

仍在訓(xùn)練中的Llama 3的400B+模型。來(lái)源：Meta官網(wǎng)

Llama 3模型即將在亞馬遜AWS、Databricks、谷歌云、Hugging Face、Kaggle、IBM WatsonX、亞馬遜Azure、英偉達(dá)NIM和Snowflake上被提供給開(kāi)發(fā)者，并獲得 AMD、AWS、戴爾、英特爾、英偉達(dá)和高通提供的硬件平臺(tái)支持。為了讓Llama 3被負(fù)責(zé)地開(kāi)發(fā)，Meta還將提供新的信任和安全工具，包括Llama Guard 2、Code Shield和CyberSec Eval 2。

同時(shí)，Meta發(fā)布了基于Llama3的官方Web版本Meta AI。目前，該平臺(tái)仍處于初級(jí)階段，只有對(duì)話和繪畫(huà)兩大功能。用戶使用對(duì)話功能無(wú)需通過(guò)注冊(cè)，使用繪畫(huà)功能則需要用戶注冊(cè)登錄賬號(hào)。

為開(kāi)源社區(qū)注入活力

Meta的AI道路向來(lái)與開(kāi)源緊密相連，Llama 3一經(jīng)推出，受到了開(kāi)源社區(qū)的熱烈歡迎。

雖然也有一些對(duì)于Llama 3的8k上下文窗口過(guò)小的吐槽，但Meta方面表示，很快就會(huì)擴(kuò)充Llama 3的上下文窗口。電子郵件初創(chuàng)企業(yè)Otherside AI的CEO兼聯(lián)合創(chuàng)始人馬特·舒默（Matt Shumer）對(duì)此也保持樂(lè)觀，并表示：“我們正在走入一個(gè)新世界，在這里，GPT-4級(jí)別的模型是開(kāi)源并可以免費(fèi)訪問(wèn)的?！?/p>

英偉達(dá)高級(jí)研究科學(xué)家范麟熙（Jim Fan）表示，即將推出的更大參數(shù)Llama 3模型標(biāo)志著開(kāi)源社區(qū)的一個(gè)“分水嶺”，可以改變?cè)S多學(xué)術(shù)研究和初創(chuàng)企業(yè)的決策方式，“預(yù)計(jì)整個(gè)生態(tài)系統(tǒng)中的活力將會(huì)激增”。

不過(guò)，值得注意的是，Meta沒(méi)有公布Llama 3的訓(xùn)練數(shù)據(jù)，只稱其全部來(lái)自公開(kāi)數(shù)據(jù)。而從嚴(yán)格意義上來(lái)說(shuō)，所謂的“開(kāi)源”軟件應(yīng)當(dāng)在開(kāi)發(fā)與分發(fā)的過(guò)程中，將包括軟件產(chǎn)品的源代碼、訓(xùn)練數(shù)據(jù)等內(nèi)容對(duì)公眾完全開(kāi)放。此前，數(shù)據(jù)公司Databricks發(fā)布的“最強(qiáng)開(kāi)源大模型”DBRX除了擁有遠(yuǎn)超出普通計(jì)算機(jī)的標(biāo)準(zhǔn)配置外，也存在這一問(wèn)題。

Llama 3的推出緊跟在Meta自研芯片取得進(jìn)步之后。就在上周，Meta公布了自主研發(fā)芯片MTIA的最新版本。MTIA是Meta專(zhuān)門(mén)為AI訓(xùn)練和推理工作設(shè)計(jì)的定制芯片系列。和去年五月官宣的Meta第一代AI推理加速器MTIA v1相比，最新版本芯片在性能上有顯著提升，專(zhuān)為Meta旗下社交軟件的排名和推薦系統(tǒng)而設(shè)計(jì)。分析指出，Meta的目標(biāo)是降低對(duì)英偉達(dá)等芯片廠商的依賴。

Previous article：OpenAI 新旗艦?zāi)Ｐ虶PT-4o發(fā)布

Previous article：谷歌大模型Gemini 發(fā)布

Return to List

Related information