10 echte Aufgaben: So will Meta KI-Agenten bewerten

Das Unternehmen Meta zeigt mit Muse Spark 1.2 neue Fähigkeiten für Visual Coding, Robotik und das Verständnis langer Videos.

Das Modell war bereits im August als Coding-Update zu Muse Spark 1.1 erschienen. Ein neuer Research-Beitrag zeigt nun, dass Meta Muse Spark 1.2 deutlich breiter positioniert. Das System verarbeitet Bilder, Videos und Spracheingaben und kann daraus eigenständig Aktionen ableiten.

Beim Visual Coding erstellt Muse Spark 1.2 laut Meta aus Bildern oder Videos funktionsfähige Webseiten und Spiele. Das Modell erfasst Layout, Hierarchie und Stil, erzeugt daraus Code und kontrolliert anschließend selbst das Ergebnis.

Muse Spark 1.2 übernimmt komplexe Arbeitsabläufe

Meta nennt mehrere Einsatzgebiete für die multimodalen und agentischen Fähigkeiten:

  • Webseiten und Spiele aus visuellen Vorlagen erzeugen
  • Roboter über Planung und Werkzeugaufrufe steuern
  • Lange Videos Szene für Szene detailliert beschreiben
  • Websuche und räumliche Objekterkennung einbinden
  • Agenten mit WildArtifactBench vergleichen

Bei der Robotik zerlegt ein Planer Aufgaben zunächst in einzelne Schritte und unterscheidet dabei auch ähnliche Objekte. Eine spezielle Muse-Spark-Variante führt diese Schritte anschließend aus und wiederholt Abläufe bei Bedarf.

Spannend ist zudem WildArtifactBench. Metas internes Bewertungsverfahren lässt Agenten bei realen Aufgaben gegeneinander antreten. Menschen und KI-Systeme bewerten die Ergebnisse. Daraus entstehen Win-Raten und Elo-Werte. Meta hat zunächst zehn Aufgaben als Vorschau veröffentlicht.

Das sind die 10 echten Aufgaben

  • Bird Sound – Audioanalyse
  • Cardiac Ultrasound – medizinische Analyse von Herzultraschall
  • Cat Mesh – digitales Design
  • Coronary Stenosis – medizinische Videoanalyse einer Koronarangiografie
  • DQN Driving – Machine-Learning-Engineering
  • Kitchen Layout – digitales Design
  • Materials Metrology – quantitative Bildanalyse für Technik und Materialwissenschaft
  • Microchip Model – 3D-Modellierung
  • Plywood Whale – digitales Design
  • Video Editing – Videobearbeitung

Muse Spark 1.2 steht über die Meta Model API und Muse Code bereit. Mark Zuckerberg hatte zudem angekündigt, die Modellgewichte zu veröffentlichen. Ich halte vor allem die Verbindung aus visueller Analyse, Code-Erzeugung und selbstständiger Kontrolle für interessant, weil sie zeigt, wohin sich leistungsfähige KI-Agenten entwickeln.


mobiFlip bei Google hervorheben – unsere Beiträge öfter sehen Quelle wählen ↗
Fehler melden Kommentare

   

Durch Kommentieren stimmst du unserer Netiquette und Datenschutzerklärung zu.

Du bist hier:
mobiFlip / News / Dienste / 10 echte Aufgaben: So will Meta KI-Agenten bewerten