
Loading commentsâŠ
Saavutus
Projekti info
Toote mÀrksÔnad
GLM-4.6V on GLM-i uusim avatud lĂ€htekoodiga multimodaalne mudelite seeria, mis on loodud ĂŒhendama visuaalset taju teostatavate toimingutega. See on saadaval kahes versioonis: GLM-4.6V (106B parameetrit) pilve- ja suure jĂ”udlusega klastrite jaoks ning GLM-4.6V-Flash (9B parameetrit) kohalikuks paigutuseks ja vĂ€ikese latentsusajaga rakendusteks. 128k mĂ€rgi kontekstiaknaga töötleb mudel ĂŒhe korraga kuni ~150 lehekĂŒlge dokumente, 200 slaidi vĂ”i ĂŒhe tunni pikkust videot. Selle silmapaistev uuendus on loomulik funktsioonikutse, mis vĂ”imaldab visuaalsetest sisenditest otse tööriistu kasutada ilma vahepealsete tekstiteisendusteta.
GLM-4.6V integreerib tööriistade kutsumise otse oma visuaalsesse torustikku, vĂ€listades vajaduse eraldi tekstipĂ”histe teisenduste jĂ€rele. See vĂ”imaldab mudelil tajuda pilti, kutsuda otsingu API-d ja tagastada pĂ”hjendatud vastuse â kĂ”ik ĂŒhes otsast lĂ”puni voos. VĂ”imekus on treenitud suuremahuliste sĂŒnteetiliste agendiandmete abil ja seda laiendatakse mudeli konteksti protokolli (MCP) kaudu.
Mudel laiendab oma treeningkonteksti 128k mĂ€rgini, vĂ”imaldades tĂ”husat ristmodaalset sĂ”ltuvuste modelleerimist suure teabesisaldusega sisendite puhul. SĂŒstemaatiline pidev eeltreening tohutute pika kontekstiga pilt-tekst andmekogumitega tagab, et mudel sĂ€ilitab sidususe sadade lehekĂŒlgede vĂ”i pikkade videote lĂ”ikes.
Eeltreeningu ajal kasutab GLM-4.6V miljardite mÔÔtmetega multimodaalset andmekogumit, mis hĂ”lmab entsĂŒklopeedilisi teadmisi. See mitmekihiline kontseptuaalne sĂŒsteem parandab pĂ”hilist visuaalset taju ja suurendab tĂ€psust ristmodaalsetes kĂŒsimustele vastamise ĂŒlesannetes, eriti keerukate vĂ”i niĆĄĆĄiteemade puhul.
UI2Code^N lÀhenemisest inspireerituna saab mudel kasutada visuaalse renderdamise tulemusi oma koodi vÔi toimingute eneseparanduseks. See "visuaalne tagasiside ahel" vÔimaldab GLM-4.6V-l oma vÀljundeid iteratiivselt tÀiustada, nÀidates potentsiaali isetÀiustuvate multimodaalsete agentide jaoks reaalsetes Àristsenaariumides.
"GLM-4.6V sulgeb tsĂŒkli tajumisest mĂ”istmiseni ja teostamiseni, vĂ”imaldades keerukaid ĂŒlesandeid, nagu rikkaliku sisuga teksti loomine ja visuaalne veebiotsing, ĂŒhes otsast lĂ”puni lĂ€bimises."
See funktsioonikutse loomulik integreerimine visuaalsete sisenditega on esimene avatud lĂ€htekoodiga multimodaalsete mudelite seas. Traditsiooniline tööriistade kasutamine nĂ”uab piltide vĂ”i videote töötlemisel mitmeid tekstipĂ”hiseid teisendusi, mis vĂ”ib pĂ”hjustada teabe kadu. GLM-4.6V vĂ€ldib seda tĂ€ielikult, vĂ”imaldades mudelil tajuda slaidi, hankida asjakohaseid andmeid veebist ja koostada struktureeritud aruande â ilma vahepealsete sammudeta. Tulemuseks on ĂŒhtne tehniline alus multimodaalsetele agentidele, mis suudavad keerukates tööriistaahelates planeerida, teostada ja end parandada.
Vajate avatud lĂ€htekoodiga multimodaalset mudelit, mis suudab tajuda, arutleda ja tegutseda ĂŒhes töövoos â olgu selleks visuaalne otsing, dokumendianalĂŒĂŒs vĂ”i esiosa koodi genereerimine. 128k kontekstiaken ja loomulik tööriistakutse muudavad selle eriti vÀÀrtuslikuks suure teabesisaldusega ĂŒlesannete jaoks, nagu pikkade videote vĂ”i keerukate aruannete töötlemine. Arendajad, kes uurivad MCP integreerimisega agendisĂŒsteeme, leiavad sisseehitatud funktsioonikutse ja visuaalse tagasiside ahela praktilise aluse isetĂ€iustuvate agentide ehitamiseks.
Teised tööriistad, mida vÔiksid kaaluda
Mistral 3 sisaldab kolme tipptasemel vĂ€ikest, tihedat mudelit (14B, 8B ja 3B) ning Mistral Large 3 â meie seni vĂ”imekaimat mudelit â hĂ”redat ekspertide segu, mis on treenitud 41B aktiivse ja 675B koguparameetriga. KĂ”ik mudelid on vĂ€lja antud Apache 2.0 litsentsi all. Ministrali mudelid esindavad oma kategoorias parimat hinna ja jĂ”udluse suhet. Samal ajal liitub Mistral Large 3 esirinnas olevate juhendamiseks peenhÀÀlestatud avatud lĂ€htekoodiga mudelite hulka.
Okara vĂ”imaldab kasutada ĂŒle 30 vĂ”imsa avatud lĂ€htekoodiga AI-mudeli ilma taristu seadistamisega tegelemata. Parimad mudelid nagu Kimi ja DeepSeek on liiga suured, et neid sĂŒlearvutil kĂ€itada â meie hoolitseme selle eest. Vaheta mudelite vahel, otsi Google'ist, Redditist, X-ist ja YouTube'ist oma vestlustes, analĂŒĂŒsi faile, genereeri pilte ja tööta koos oma meeskonnaga. KĂ”ik on krĂŒpteeritud ja me ei treeni kunagi sinu andmete peal.
TranslateGemma on uus avatud AI tĂ”lkemudelite komplekt, mis pĂ”hineb Google'i Gemma 3-l. See vĂ”imaldab kvaliteetset suhtlust 55 keeles, ĂŒhendades tugeva tĂ€psuse erakordse tĂ”hususega. Loodud töötama mobiilseadmetes, kohalikes seadmetes ja pilvekeskkondades, ilma et see kahjustaks jĂ”udlust.
Me tutvustame PersonaPlexi, tĂ€isdupleksset vestluslikku AI-mudelit, mis vĂ”imaldab loomulikke vestlusi kohandatavate hÀÀlte ja rollidega. PersonaPlex haldab katkestusi ja tagasisideid, sĂ€ilitades samal ajal valitud isiku, ĂŒletades olemasolevaid sĂŒsteeme vestlusdĂŒnaamikas ja ĂŒlesannete tĂ€itmises.
Looja
async_apple
VÔrdle
Alternatiivid
Loading commentsâŠ