Wissen · Grundlagen

Physical AI in acht Kapiteln.

Ein kompakter Einstieg für Geschäftsführung, Produktion und IT: wie kognitive Roboter lernen, was sie heute können und worauf es bei Sicherheit und Bewertung ankommt.

  • 8 Kapitel
  • ca. 7 Min. Lesezeit

Was ist Physical AI?

Künstliche Intelligenz, die nicht nur Texte oder Bilder verarbeitet, sondern in der physischen Welt handelt.

Physical AI -- oft auch Embodied AI genannt -- bezeichnet KI-Systeme mit einem Körper: Roboter, die ihre Umgebung über Kameras und Sensoren wahrnehmen, daraus Entscheidungen ableiten und über Motoren und Greifer handeln. Wir sprechen von kognitiven Robotern.

Der entscheidende Unterschied zur klassischen Robotik: Das Verhalten wird nicht mehr Zeile für Zeile programmiert, sondern zu großen Teilen aus Daten gelernt. Dadurch können Roboter mit Varianz umgehen -- mit Teilen, die jedes Mal etwas anders liegen, mit wechselnden Aufgaben und mit Umgebungen, die nicht für Roboter gebaut wurden.

Technisch läuft dabei ständig derselbe Kreislauf ab: wahrnehmen, entscheiden, handeln -- und am Ergebnis prüfen, ob die Handlung funktioniert hat. Je schneller und robuster dieser Kreislauf, desto nützlicher der Roboter.

  • Wahrnehmen

    Kameras, Tiefensensoren, LiDAR und Kraftsensoren liefern ein Bild der Umgebung.

  • Entscheiden

    Ein KI-Modell leitet aus Wahrnehmung und Auftrag die nächste Bewegung ab.

  • Handeln

    Motoren, Gelenke und Greifer setzen die Entscheidung um -- oft viele Male pro Sekunde.

Klassische Automatisierung oder kognitiver Roboter?

Kein Entweder-oder: Beide Ansätze haben ihre Stärken -- entscheidend ist die Aufgabe.

Klassische Industrieroboter sind unschlagbar, wenn Abläufe hochvolumig, immer gleich und gut strukturiert sind: Schweißen, Lackieren, Palettieren in festen Mustern. Sie sind präzise, schnell und über Jahrzehnte erprobt -- aber jede Änderung kostet Programmier- und Umrüstaufwand.

Kognitive Roboter spielen ihre Stärken dort aus, wo Varianz den Alltag bestimmt: wechselnde Teile, kleine Losgrößen, unstrukturierte Umgebungen und Aufgaben, die bisher nur Menschen erledigen konnten. Dafür sind sie heute meist langsamer und weniger vorhersagbar als klassische Anlagen.

In der Praxis ergänzen sich beide. Die richtige Frage lautet nicht „Welcher Roboter ist besser?“, sondern „Wie viel Varianz steckt in dieser Aufgabe -- und was kostet sie uns heute?“

  • Klassisch: programmiert

    Fest definierte Bewegungen, hohe Präzision und Geschwindigkeit, hoher Aufwand bei jeder Änderung.

  • Kognitiv: gelernt

    Aus Demonstrationen und Daten gelernt, tolerant gegenüber Varianz, heute noch langsamer und weniger vorhersagbar.

Wie Roboter lernen

Vormachen, üben, übertragen: die wichtigsten Lernwege kognitiver Roboter.

Viele praktische Fortschritte der letzten Jahre kommen aus dem Imitation Learning: Ein Mensch steuert den Roboter per Teleoperation durch eine Aufgabe, der Roboter zeichnet dabei auf, was er sieht und wie er sich bewegt. Aus vielen solcher Demonstrationen lernt ein Modell -- die sogenannte Policy --, die Aufgabe selbst auszuführen.

Beim Reinforcement Learning probiert der Roboter selbst aus und wird für Erfolg belohnt. Weil das in der realen Welt langsam und riskant wäre, geschieht es meist in der Simulation. Die Kunst liegt dann im Sim-to-Real-Transfer: Das Gelernte muss auch mit echter Reibung, echtem Licht und echtem Sensorrauschen funktionieren. Besonders erfolgreich ist dieser Weg bisher bei Fortbewegung und Balance.

Wie viele Demonstrationen eine Aufgabe braucht, hängt stark von ihr ab -- und davon, ob ein vortrainiertes Modell als Ausgangspunkt dient. Mit einem Foundation-Modell genügen für eine eng umrissene Aufgabe oft deutlich weniger Beispiele als beim Training von Grund auf.

  • Imitation Learning

    Lernen aus menschlichen Demonstrationen, meist per Teleoperation aufgezeichnet.

  • Reinforcement Learning

    Lernen durch Ausprobieren und Belohnung, meist in der Simulation.

  • Fine-Tuning

    Ein vortrainiertes Modell wird mit wenigen, gezielten Daten an eine konkrete Aufgabe angepasst.

Foundation-Modelle für Roboter

Was große Sprachmodelle für Text sind, werden Vision-Language-Action-Modelle für Roboter.

Vision-Language-Action-Modelle (VLA) verbinden drei Dinge: Sie sehen (Kamerabilder), verstehen Sprache (den Auftrag, etwa „Leg das blaue Teil in die Kiste“) und geben Aktionen aus (Gelenkbewegungen oder Greiferbefehle). Vortrainiert werden sie auf großen Datensätzen aus vielen Robotern und Aufgaben, danach werden sie für den konkreten Einsatz feinjustiert.

Neben geschlossenen Modellen gibt es eine wachsende Zahl offener Modelle, deren Gewichte frei verfügbar sind -- etwa OpenVLA, π0 oder SmolVLA. Für Unternehmen heißt das: Modelle lassen sich prüfen, anpassen und auf eigener Hardware betreiben. Genau darauf setzen wir.

Ein zweiter Forschungsstrang sind Weltmodelle: Modelle, die vorhersagen, wie sich die Umgebung durch eine Handlung verändert. Sie sollen Robotern helfen, vorauszuplanen und mit unbekannten Situationen umzugehen.

Daten: der eigentliche Engpass

Für Sprachmodelle gibt es das Internet. Für Roboter gibt es keine vergleichbare Datenquelle.

Roboterdaten müssen erzeugt werden: durch Teleoperation, in der Simulation oder im laufenden Betrieb. Offene Sammlungen wie Open X-Embodiment oder die Datensätze der LeRobot-Community helfen beim Vortraining -- für die eigene Aufgabe braucht es aber fast immer eigene Daten aus der eigenen Umgebung.

Dabei zählt Qualität mehr als Menge: saubere, konsistente Demonstrationen, gut abgedeckte Varianten und dokumentierte Fehlerfälle. Ebenso wichtig sind Daten aus dem Betrieb -- Erfolgsquoten, Eingriffe, Abbrüche --, denn erst sie zeigen, wo ein Modell nachtrainiert werden muss.

Weil diese Daten Ihre Prozesse, Ihre Produkte und oft auch Ihre Mitarbeitenden zeigen, sind sie ein Wettbewerbsfaktor. Wo sie gespeichert und verarbeitet werden und wer sie nutzen darf, sollte vor dem ersten Pilot geklärt sein.

Hardware und Bauformen

Die beste KI nützt wenig, wenn der Körper nicht zur Aufgabe passt.

Kognitive Roboter gibt es in vielen Bauformen. Jede bringt eigene Stärken und Grenzen mit -- und nicht jede Aufgabe braucht Beine.

Entscheidend sind neben der Bauform die Freiheitsgrade, die Traglast, die Sensorik -- von Tiefenkameras über LiDAR bis zu Kraft- und Tastsensoren -- sowie die Rechenleistung an Bord. Bei mobilen Systemen kommt die Akkulaufzeit hinzu, die im Dauerbetrieb oft der limitierende Faktor ist.

Datenblätter zeigen Bestwerte unter Idealbedingungen. Was ein System in Ihrer Umgebung leistet, zeigt erst ein Test.

  • Arme & Cobots

    Stationär, präzise, bewährt -- ideal für feste Arbeitsplätze.

  • Mobile Manipulatoren

    Ein Arm auf einer fahrbaren Basis -- für Aufgaben an wechselnden Orten.

  • Vierbeiner

    Robust und geländegängig -- für Inspektion und Transport auf unebenem Boden.

  • Zweibeiner

    Menschenähnliche Gestalt für Umgebungen, die für Menschen gebaut sind. Technisch am anspruchsvollsten.

Sicherheit und Souveränität

Ein Roboter, der mit Menschen arbeitet und am Netzwerk hängt, braucht zwei Arten von Sicherheit -- und klare Kontrolle.

Funktionale Sicherheit schützt Menschen im Arbeitsbereich. Grundlage ist eine Risikobeurteilung; für Industrie- und kollaborierende Roboter geben Normen wie ISO 10218 und ISO/TS 15066 den Rahmen vor, etwa für Kraft- und Geschwindigkeitsbegrenzung. Bei lernenden Systemen kommt eine neue Frage hinzu: Was passiert, wenn das Modell falsch liegt? Die Antwort sind Schutzfunktionen, die unabhängig von der KI greifen.

Cybersecurity schützt den Roboter und Ihr Netz. Ein kognitiver Roboter ist ein vernetzter Computer mit Kameras und Mikrofonen -- er gehört wie jedes andere Gerät in ein OT-Sicherheitskonzept: Netzsegmentierung, Zugriffsrechte, geprüfte Updates, Protokollierung.

Souveränität schließlich bedeutet, dass Sie die Kontrolle über Daten, Modelle und Updates behalten. Auch der regulatorische Rahmen wächst: Die neue EU-Maschinenverordnung gilt ab Januar 2027, dazu kommen der EU AI Act und der Cyber Resilience Act.

  • Safety

    Schützt Menschen: Risikobeurteilung, Kraftbegrenzung, Not-Halt, Fallback.

  • Security

    Schützt Systeme: Segmentierung, Zugriffskontrolle, signierte Updates.

  • Souveränität

    Sichert Kontrolle: Daten, Modelle und Betrieb in Ihrer Hand.

Bewerten und einführen

Eine überzeugende Demo ist kein Business Case. Messwerte aus der eigenen Umgebung sind es.

Bewerten Sie kognitive Roboter mit denselben Maßstäben wie jeden anderen Prozess: Wie oft gelingt die Aufgabe? Wie lange dauert sie? Wie oft muss ein Mensch eingreifen? Und was kostet das Ganze über die Laufzeit -- inklusive Integration, Wartung und Datenaufbereitung?

Bewährt hat sich ein schrittweises Vorgehen: Aufgabe auswählen, Ausgangswerte messen, einen klar begrenzten Pilot mit vorher festgelegten Erfolgskriterien fahren -- und erst dann über den Rollout entscheiden. So wird aus Neugier eine belastbare Entscheidung.

  • Erfolgsquote

    Anteil der Durchläufe, die ohne menschliche Hilfe gelingen.

  • Zykluszeit

    Dauer pro Durchlauf -- im Vergleich zum heutigen Prozess.

  • Eingriffe pro Stunde

    Wie oft ein Mensch helfen oder korrigieren muss.

  • Gesamtkosten

    Anschaffung, Integration, Energie, Wartung und Daten über die Laufzeit.

Grundlagen verstanden? Dann wird es konkret.

Wir übertragen dieses Wissen auf Ihre Prozesse: im Workshop mit Ihrem Team oder in einer herstellerneutralen Bewertung.