Infrastructura Digio

Modele AI și GPU

Rulați agenți pe modele de frontieră gestionate astăzi sau închiriați capacitate GPU, implementați propriile greutăți și direcționați sarcinile Digio către punctele finale private în același spațiu de lucru.

Claude, GPT, Gemeni Alegerea modelului per agent Închiriere GPU și BYOM
Modele gestionate

Modele disponibile în Digio astăzi

Atribuiți un model implicit pentru fiecare agent sau înlocuiți pentru fiecare sarcină. Utilizarea este măsurată în jetoane Digio din soldul planului dvs. - același portofel, indiferent dacă agentul sună Sonnet, GPT-4o sau Gemini Flash.

Claude antropic

  • Claude Opus 4.7 Raționament emblematic, context lung, arhitectură și activitate strategică.
  • Claude Opus 4.6 Opus de generație anterioară pentru analiză stabilă, de înaltă calitate.
  • Claude Sonnet 4.6 Driver zilnic: codare, scriere și bucle de agent în mai mulți pași.
  • Claude Sonnet 4.5 / 4 Niveluri Sonnet rapide cu memorare rapidă în cache pe sarcinile de lucru acceptate.
  • Claude Haiku 4.5 Schițe cu latență redusă, clasificare și sarcini secundare cu volum mare.

Eticheta interfață de utilizare a site-ului web B2B SaaS. Traduceți în ro natural: OpenAI

  • GPT-5.5 / GPT-5.4 / GPT-5.2 Cea mai recentă familie GPT-5 pentru sarcini de lucru generale și agentice.
  • GPT-4.1 & GPT-4o Chat multimodal de încredere și utilizarea instrumentelor pentru agenții de producție.
  • GPT-4o mini Rutare rentabilă pentru rezumate și pași simpli.
  • o3 / o3-pro / o3-mini / o4-mini Modele axate pe raționament pentru matematică, planificare și verificare.
  • GPT-5.3 Codex & Codex mini Generarea codului, refactorarea și abilitățile de agenți repo-aware.

Google Gemeni

  • Gemini 2.5 Pro Cercetare în context lung și extracție structurată.
  • Gemini 2.5 Flash Pași de agent de mare debit cu rate competitive de token.
  • Gemini 2.0 Flash Treceri ultra-rapide pentru lucrări de analizare, etichetare și lot.

API-uri deschise și specializate

  • DeepSeek Chat & Reasoner Valoare puternică pentru sarcinile de stil de chat și lanț de gândire.
  • Mistral Large Opțiune găzduită în Europa pentru echipele de agenți multilingvi.
  • Llama 3.3 70B Model de clasă cu greutăți deschise prin API - se împerechează bine cu GPU-ul privat.
  • Grok 3 Model orientat în timp real pentru știri și agenții de monitorizare socială.
  • Sonar Pro Răspunsuri bazate pe căutare pentru agenții de cercetare.
  • Command R+ Fluxuri de lucru pentru chat și recuperare pentru întreprinderi prietenoase cu RAG.

Model list and token economics evolve with provider releases. Your workspace shows live options when you assign a model to an agent; Digio Tokens debit from the same balance as in pricing.

Utilizare

Cum aleg agenții un model

Coordonatorul poate recomanda Sonnet vs Opus vs un model flash mai ieftin bazat pe tipul de sarcină. Utilizatorii puternici stabilesc valori implicite pentru fiecare rol de agent - cercetare pe Sonnet, revizuire finală pe Opus, etichetare în bloc pe Haiku sau Gemini Flash.

  • Per agent — default model in agent settings; override in To do or chat when needed.

  • Metered fairly — input, output, and cached tokens map to Digio Token charges (see usage in your wallet).

  • Skills stay the same — tools and integrations work across models; only latency and cost profile change.

  • Plan limits — more agents and monthly Digio Tokens on higher tiers; top up anytime on the pricing page.

Închiriere GPU

Închiriază GPU și rulează propriile modele

Aveți nevoie de o ajustare fină, de un punct de control cu ​​aer întrerupt sau de prețuri de inferență previzibile? Adăugați capacitate GPU dedicată spațiului dvs. de lucru Digio, instalați stiva de servire pe care o preferați și agenți punctuali la punctul final privat.

Instanțele dedicate

Noduri GPU orare sau lunare (clasa A100, H100, L40S) atașate chiriașului dvs. — izolate de alți clienți.

Greutățile tale

Încărcați safetensors, GGUF sau extrageți din registry; rulați Llama, Mistral, Qwen și melodii fine personalizate.

Servire standard

Imaginile vLLM, TGI, Ollama sau container pe care le întrețineți — agenții Digio apelează o adresă URL de bază compatibilă cu OpenAI.

Aceeași orchestrație

De făcut, chatul în echipă, abilitățile și colaborarea neschimbate - doar backend-ul de inferență este al tău.

Rutare hibridă

Trimiteți pași sensibili la GPU privat și utilizați Claude sau GPT pentru cercetare publică într-un singur flux de lucru.

Controalele întreprinderii

Peering VPC, ieșire statică, jurnalele de audit și listele de modele permise pentru echipele reglementate.

Adu-ți propriul model

Instalați și conectați un model personalizat

Configurare tipică de la zero la agenții care vă apelează punctul final:

  1. Rezervați GPU

    Alegeți VRAM, regiunea și timpul de funcționare (burst vs always-on). Depozitul pentru greutăți este livrat cu instanța sau vă montează găleata.

  2. Implementați stiva

    Porniți o imagine de difuzare sau SSH, instalați drivere CUDA și încărcați punctele de control. Controalele de sănătate confirmă că modelul este gata.

  3. Înregistrați punctul final

    Adăugați adresa URL de bază, cheia API și id-ul modelului în setările spațiului de lucru. Digio validează latența și formatul jetonului înainte de a fi difuzat.

  4. Atribuiți agenților

    Alegeți modelul dvs. privat ca implicit pentru agenții selectați; modelele Claude/GPT gestionate rămân disponibile unul lângă altul.

Închirierea GPU-ului este facturată separat de abonamentele la planul Digio. Contactați-ne pentru planificarea capacității, SLA și migrarea de la un cluster de inferență existent.

Eticheta interfață de utilizare a site-ului web B2B SaaS. Traduceți în ro natural: Întrebări frecvente

Întrebări despre modele și GPU

Alegerea API-urilor gestionate versus inferența auto-găzduită pe Digio.

Plătesc de două ori—plan plus API?

Abonamentul dvs. Digio acoperă infrastructura, agenții și jetoanele Digio incluse. Utilizarea modelului gestionat debitează acel token echilibrat cu indicativele de intrare/ieșire reale. Închirierea GPU este un supliment pentru mașinile pe care le controlați.

Pot diferiți agenți să folosească modele diferite?

Da — fiecare agent poate avea propriul său implicit. Sarcinile și chat-urile pot suprascrie pentru o singură rulare fără a modifica valoarea implicită globală.

Care este diferența dintre Sonnet și Opus?

Opus este reglat pentru un raționament mai dur și planuri mai coerente; Sonnet este mai rapid și mai ieftin pentru buclele agentului de zi cu zi. Haiku și modelele flash-class sunt cele mai bune pentru subsarcinile de volum.

Pot rula doar propriul meu model și pot bloca API-urile cloud?

Spațiile de lucru ale întreprinderii pot restricționa furnizorii de modele de ieșire și pot direcționa tot traficul agenților către punctul final de GPU. Modul hibrid este implicit pentru majoritatea echipelor.

Ce dimensiuni de GPU sunt disponibile?

Ofertele depind de regiune și cerere – de obicei niveluri VRAM de 24–80 GB pentru modelele de clasă 7B–70B și noduri multi-GPU pentru stive mai mari. Vă ajutăm să dimensionăm VRAM din numărul și cuantizarea parametrilor dvs.

Utilizarea GPU-ului privat încă consumă jetoane Digio?

Orchestrarea (agenți, sarcini, stocare) rămâne pe planul dvs. Inferența asupra GPU-ului dvs. este facturată ca timp GPU; opțional, puteți măsura utilizarea în formă de jeton pentru rambursarea internă.

Alegeți modele gestionate sau aduceți-vă GPU-ul

Începeți pe Claude și GPT astăzi, apoi adăugați GPU dedicat când sunteți gata să găzduiți greutăți personalizate - aceiași agenți, aceleași sarcini, inferența dvs.