{"id":127601,"date":"2026-10-01T09:00:25","date_gmt":"2026-10-01T07:00:25","guid":{"rendered":"https:\/\/startupvalley.news\/de\/?p=127601"},"modified":"2026-10-01T09:00:26","modified_gmt":"2026-10-01T07:00:26","slug":"deepslate-sprach-ki-speech-to-speech-modell","status":"publish","type":"post","link":"https:\/\/startupvalley.news\/de\/deepslate-sprach-ki-speech-to-speech-modell\/","title":{"rendered":"7,7 Millionen Euro f\u00fcr Deepslate: Wie ein Berliner Startup die weltweit schnellste Sprach-KI baut"},"content":{"rendered":"\n
Das Berliner Model Lab trainiert eigene Speech-to-Speech-Modelle und hostet in Deutschland. Laut Artificial Analysis ist es das weltweit schnellste Modell seiner Art.<\/em><\/p>\n\n\n\n Berlin, 01.10.26<\/strong> \u2013 Deepslate, ein Berliner AI Model Lab f\u00fcr Sprach-KI, hat eine Seed-Finanzierungsrunde \u00fcber 7,7 Millionen Euro abgeschlossen. Angef\u00fchrt wird die Runde vom M\u00fcnchener Technologie-Investor 42CAP. Weitere Investoren sind Alstin Capital, Bestandsinvestor SIVentures sowie mehrere Business Angels. Deepslate trainiert eigene Speech-to-Speech-Modelle. Sie verarbeiten gesprochene Sprache direkt, ohne Umweg \u00fcber Text. In der unabh\u00e4ngigen Vergleichsmessung von Artificial Analysis ist Deepslate das weltweit schnellste Speech-to-Speech-Modell (Stand September 2026). Versicherer, Contact Center und Plattformen setzen die Technologie bereits produktiv ein. Mit dem Kapital baut das 15-k\u00f6pfige Team Modelltraining, Vertrieb und die europ\u00e4ische Infrastruktur aus.<\/p>\n\n\n\n Der Markt f\u00fcr Sprach-KI besteht \u00fcberwiegend aus Plattformen und Integratoren, die fremde Modelle \u00fcber eine API verpacken. Deepslate trainiert eigene Modelle. In Europa gibt es nur eine Handvoll Unternehmen, die das tun. KI-Technologie beziehen europ\u00e4ische Unternehmen bisher meist aus den USA. Latenz, Verst\u00e4ndnis f\u00fcr europ\u00e4ische Sprachen und Datensicherheit sind dabei nicht verhandelbar. Deepslate hat ein Voice-AI-Modell mit Schwerpunkt auf europ\u00e4ischen Sprachen entwickelt, das vollst\u00e4ndig in der EU gehostet wird.<\/p>\n\n\n\n 2023 gr\u00fcndeten Paskal Paesler und Jan Brachth\u00e4user in Berlin ihr erstes gemeinsames Unternehmen: Unter Anderem in dem Produkt war ein KI-Assistent, der in Meetings mith\u00f6rt und Fragen mit Unternehmenswissen beantwortet. Der Assistent scheiterte an der Sprach-KI seiner Zeit. Bis ein Sprachagent antwortete, vergingen rund drei Sekunden. Ein nat\u00fcrliches Gespr\u00e4ch war damit unm\u00f6glich. Der Grund lag in der Architektur. Herk\u00f6mmliche Sprach-KI arbeitet in drei Stufen:<\/p>\n\n\n\n Gesprochenes wird in Text umgewandelt, von einem Sprachmodell verarbeitet und wieder in Sprache \u00fcbersetzt. Jede Konvertierung kostet Zeit. Tonfall, Betonung, Ironie und Dialekt gehen unterwegs verloren. Die Gr\u00fcnder lasen monatelang Forschungsarbeiten und Open-Source-Projekte zu einem damals kaum beachteten Ansatz und beschlossen, das Modell selbst zu bauen. Aus den Recherchen wurde Deepslate.<\/p>\n\n\n\n F\u00fcr europ\u00e4ische Unternehmen kommt ein zweites Problem hinzu. Modelle, die \u00fcberwiegend auf US-Englisch trainiert wurden, scheitern regelm\u00e4\u00dfig an deutschen Namen, Stra\u00dfenadressen und Dialekten. In regulierten Branchen wie Versicherung oder Banking hat ein falsch verstandener Name oder eine vertauschte Hausnummer teure Folgen.<\/p>\n\n\n\n Deepslate ersetzt die dreistufige Kette durch ein einziges durchgehendes Modell. Audio geht hinein, Audio kommt heraus. Semantik und Prosodie liest das Modell direkt aus dem Klang, ohne verlustbehaftete Textzwischenstufe. Technisch besteht das System aus drei selbst trainierten Komponenten: einem Speech Encoder, der die Audio-Wellenform in einen semantisch-prosodischen Vektorraum abbildet, einem Reasoning Core auf Basis eines Open-Weights-Frontier-Sprachmodells, das Deepslate sprachspezifisch nachtrainiert, und einem Speech Decoder, der Audio mit kontrollierter Prosodie und nat\u00fcrlichem Turn-Taking direkt aus den Reasoning-Embeddings erzeugt.<\/p>\n\n\n\n Der Kern der Architektur ist die Entkopplung. Encoder und Decoder h\u00e4ngen \u00fcber trainierbare Projektoren an einem austauschbaren Sprachmodell. Kommt eine neue Sprachmodell-Generation, trainiert Deepslate nur die Projektoren neu. Ein Trainingslauf kostet dann Tage statt Monate und einen Bruchteil der Rechenzeit, die das gemeinsame Vortraining eines Omni-Modells verlangt.<\/p>\n\n\n\n Sprach-KI steht vor einem Zielkonflikt. Modelle, die im Gespr\u00e4ch komplex schlussfolgern, werden langsam. Modelle, die schnell antworten, bleiben oberfl\u00e4chlich. Deepslate l\u00f6st diesen Konflikt anders als die gro\u00dfen US-Anbieter.<\/p>\n\n\n\n Die Messmethodik ist \u00f6ffentlich dokumentiert: github.com\/deepslate-labs\/deepslate-benchmarks<\/p>\n\n\n\n Die effiziente Architektur schl\u00e4gt sich im Preis nieder. Deepslate bietet sein Modell \u00fcber eine Self-Service-Plattform mit API f\u00fcr bis zu 2 Cent pro Gespr\u00e4chsminute an. Vergleichbare Echtzeitmodelle aus den USA kosten je nach Nutzung zwischen 6 und 15 Cent pro Minute. Entwickler und Start-ups k\u00f6nnen das Modell damit ohne Vertragsgespr\u00e4ch einsetzen. F\u00fcr Plattformanbieter und Enterprise-Kunden gibt es Volumen- und Self-Hosting-Modelle.<\/p>\n\n\n\n Versicherer, Banken, Kliniken und Beh\u00f6rden d\u00fcrfen Kundendaten h\u00e4ufig nicht an US-Cloud-Anbieter \u00fcbermitteln. Deepslate betreibt seine Modelle in der Telekom Cloud in Deutschland. Alternativ l\u00e4uft das Modell vollst\u00e4ndig in der Infrastruktur des Kunden, auf Wunsch ohne Verbindung nach au\u00dfen. In dieser Variante hat auch Deepslate selbst keinen Zugriff auf die Daten. Das Unternehmen ist nach ISO 27001 zertifiziert. Auftragsverarbeitungsvertrag, Subprozessorenliste und Hosting-Region liegen offen zur Pr\u00fcfung.<\/p>\n\n\n\n \u201eDatensouver\u00e4nit\u00e4t ist f\u00fcr unsere Kunden kein Nice-to-have, sondern Voraussetzung“, sagt Paesler. \u201eUnd sie ist pr\u00fcfbar oder sie ist nichts. Deshalb legen wir offen, wo gerechnet wird, wer Subprozessor ist und was noch offen ist.“<\/p>\n\n\n\n \u201eEuropa braucht eigene Sprachmodelle, und Deepslate ist eines der wenigen Teams hier, die ein eigenes Speech-to-Speech-Modell trainieren“, sagt Julian von Fischer, General Partner bei 42CAP. \u201eWas uns an Paskal und Jan \u00fcberzeugt hat, ist ihre technische Tiefe: Mit einem kleinen Team und einem Bruchteil der Rechenzeit gro\u00dfer Labore haben sie das schnellste Speech-to-Speech-Modell der Welt gebaut.“<\/p>\n<\/blockquote>\n\n\n\n \u201ePaskal und Jan haben bereits vor Deepslate latenzkritische Systeme f\u00fcr Millionen Nutzer skaliert. Heute \u00fcbertragen sie diese Erfahrung auf ein eigenes Speech-to-Speech-Modell, das nat\u00fcrliche Echtzeitgespr\u00e4che datensicher und lokal auf der Infrastruktur des Kunden erm\u00f6glicht. Wir haben investiert, weil wir ein weltweit wettbewerbsf\u00e4higes Voice AI Model Lab sehen, das eine zentrale europ\u00e4ische L\u00f6sung f\u00fcr Voice AI aufbauen wird“, so Andreas Schenk, Partner bei Alstin Capital.<\/p>\n<\/blockquote>\n\n\n\n Bei Bildern und Videos ist KI-generierter Inhalt inzwischen kaum noch von echten zu unterscheiden. Bei Sprache in Echtzeit ist das noch nicht der Fall. Genau diese L\u00fccke schlie\u00dft Deepslate. Der Kundenservice ist dabei nur der erste Markt. Langfristig sieht das Unternehmen Sprache als nat\u00fcrliche Schnittstelle zwischen Mensch und Maschine: in Fahrzeugen, in Ger\u00e4ten und in Robotern. Erste Kunden nutzen das Modell bereits als Sprachschnittstelle f\u00fcr ihre eigenen KI-Systeme.<\/p>\n\n\n\n Deepslate ist ein Berliner AI Model Lab, das eigene Sprach-KI entwickelt. Das Unternehmen trainiert ein Speech-to-Speech-Modell, das gesprochene Sprache direkt verarbeitet, ohne sie zun\u00e4chst in Text umzuwandeln.<\/p> <\/div> Deepslate hat eine Seed-Finanzierungsrunde \u00fcber 7,7 Millionen Euro<\/strong> abgeschlossen. Angef\u00fchrt wird die Runde von 42CAP, weitere Investoren sind Alstin Capital, SIVentures sowie mehrere Business Angels.<\/p> <\/div> Das Speech-to-Speech-Modell verarbeitet Audio direkt und soll dadurch besonders schnelle und nat\u00fcrliche Gespr\u00e4che erm\u00f6glichen. Zudem liegt der Schwerpunkt auf europ\u00e4ischen Sprachen und einer europ\u00e4ischen Infrastruktur mit Hosting in Deutschland.<\/p> <\/div> <\/div>\n\n\n\n Deepslate Gr\u00fcnder Paskal Paesler<\/a> und Jan Brachth\u00e4user<\/a> Bildcredits: Deepslate AI generated<\/p>\n\n\n\n Quelle Maschmeyer Group MM Support GmbH<\/p>\n\n\n\nEin Model Lab, kein Telefonie-Produkt<\/h3>\n\n\n\n
Wie Deepslate entstand: drei Sekunden waren zu lang<\/h3>\n\n\n\n
Audio rein, Audio raus<\/h3>\n\n\n\n
Messwerte: Tempo ohne Verlust an Denkleistung<\/h3>\n\n\n\n
\n
Zwei Cent pro Minute<\/h3>\n\n\n\n
Souver\u00e4nit\u00e4t, die gepr\u00fcft werden kann<\/h3>\n\n\n\n
Wohin die Finanzierung flie\u00dft<\/h3>\n\n\n\n
\n
\n
\n
Ausblick: Sprache als Schnittstelle zur Maschine<\/h3>\n\n\n\n