{"id":127601,"date":"2026-10-01T09:00:25","date_gmt":"2026-10-01T07:00:25","guid":{"rendered":"https:\/\/startupvalley.news\/de\/?p=127601"},"modified":"2026-10-01T09:00:26","modified_gmt":"2026-10-01T07:00:26","slug":"deepslate-sprach-ki-speech-to-speech-modell","status":"publish","type":"post","link":"https:\/\/startupvalley.news\/de\/deepslate-sprach-ki-speech-to-speech-modell\/","title":{"rendered":"7,7 Millionen Euro f\u00fcr Deepslate: Wie ein Berliner Startup die weltweit schnellste Sprach-KI baut"},"content":{"rendered":"\n

Deepslate sichert sich 7,7 Millionen Euro f\u00fcr europ\u00e4ische Sprach-KI<\/h2>\n\n\n\n

Das Berliner Model Lab trainiert eigene Speech-to-Speech-Modelle und hostet in Deutschland. Laut Artificial Analysis ist es das weltweit schnellste Modell seiner Art.<\/em><\/p>\n\n\n\n

Berlin, 01.10.26<\/strong> \u2013 Deepslate, ein Berliner AI Model Lab f\u00fcr Sprach-KI, hat eine Seed-Finanzierungsrunde \u00fcber 7,7 Millionen Euro abgeschlossen. Angef\u00fchrt wird die Runde vom M\u00fcnchener Technologie-Investor 42CAP. Weitere Investoren sind Alstin Capital, Bestandsinvestor SIVentures sowie mehrere Business Angels. Deepslate trainiert eigene Speech-to-Speech-Modelle. Sie verarbeiten gesprochene Sprache direkt, ohne Umweg \u00fcber Text. In der unabh\u00e4ngigen Vergleichsmessung von Artificial Analysis ist Deepslate das weltweit schnellste Speech-to-Speech-Modell (Stand September 2026). Versicherer, Contact Center und Plattformen setzen die Technologie bereits produktiv ein. Mit dem Kapital baut das 15-k\u00f6pfige Team Modelltraining, Vertrieb und die europ\u00e4ische Infrastruktur aus.<\/p>\n\n\n\n

Ein Model Lab, kein Telefonie-Produkt<\/h3>\n\n\n\n

Der Markt f\u00fcr Sprach-KI besteht \u00fcberwiegend aus Plattformen und Integratoren, die fremde Modelle \u00fcber eine API verpacken. Deepslate trainiert eigene Modelle. In Europa gibt es nur eine Handvoll Unternehmen, die das tun. KI-Technologie beziehen europ\u00e4ische Unternehmen bisher meist aus den USA. Latenz, Verst\u00e4ndnis f\u00fcr europ\u00e4ische Sprachen und Datensicherheit sind dabei nicht verhandelbar. Deepslate hat ein Voice-AI-Modell mit Schwerpunkt auf europ\u00e4ischen Sprachen entwickelt, das vollst\u00e4ndig in der EU gehostet wird.<\/p>\n\n\n\n

Wie Deepslate entstand: drei Sekunden waren zu lang<\/h3>\n\n\n\n

2023 gr\u00fcndeten Paskal Paesler und Jan Brachth\u00e4user in Berlin ihr erstes gemeinsames Unternehmen: Unter Anderem in dem Produkt war ein KI-Assistent, der in Meetings mith\u00f6rt und Fragen mit Unternehmenswissen beantwortet. Der Assistent scheiterte an der Sprach-KI seiner Zeit. Bis ein Sprachagent antwortete, vergingen rund drei Sekunden. Ein nat\u00fcrliches Gespr\u00e4ch war damit unm\u00f6glich. Der Grund lag in der Architektur. Herk\u00f6mmliche Sprach-KI arbeitet in drei Stufen:<\/p>\n\n\n\n

Gesprochenes wird in Text umgewandelt, von einem Sprachmodell verarbeitet und wieder in Sprache \u00fcbersetzt. Jede Konvertierung kostet Zeit. Tonfall, Betonung, Ironie und Dialekt gehen unterwegs verloren. Die Gr\u00fcnder lasen monatelang Forschungsarbeiten und Open-Source-Projekte zu einem damals kaum beachteten Ansatz und beschlossen, das Modell selbst zu bauen. Aus den Recherchen wurde Deepslate.<\/p>\n\n\n\n

F\u00fcr europ\u00e4ische Unternehmen kommt ein zweites Problem hinzu. Modelle, die \u00fcberwiegend auf US-Englisch trainiert wurden, scheitern regelm\u00e4\u00dfig an deutschen Namen, Stra\u00dfenadressen und Dialekten. In regulierten Branchen wie Versicherung oder Banking hat ein falsch verstandener Name oder eine vertauschte Hausnummer teure Folgen.<\/p>\n\n\n\n

Audio rein, Audio raus<\/h3>\n\n\n\n

Deepslate ersetzt die dreistufige Kette durch ein einziges durchgehendes Modell. Audio geht hinein, Audio kommt heraus. Semantik und Prosodie liest das Modell direkt aus dem Klang, ohne verlustbehaftete Textzwischenstufe. Technisch besteht das System aus drei selbst trainierten Komponenten: einem Speech Encoder, der die Audio-Wellenform in einen semantisch-prosodischen Vektorraum abbildet, einem Reasoning Core auf Basis eines Open-Weights-Frontier-Sprachmodells, das Deepslate sprachspezifisch nachtrainiert, und einem Speech Decoder, der Audio mit kontrollierter Prosodie und nat\u00fcrlichem Turn-Taking direkt aus den Reasoning-Embeddings erzeugt.<\/p>\n\n\n\n

Der Kern der Architektur ist die Entkopplung. Encoder und Decoder h\u00e4ngen \u00fcber trainierbare Projektoren an einem austauschbaren Sprachmodell. Kommt eine neue Sprachmodell-Generation, trainiert Deepslate nur die Projektoren neu. Ein Trainingslauf kostet dann Tage statt Monate und einen Bruchteil der Rechenzeit, die das gemeinsame Vortraining eines Omni-Modells verlangt.<\/p>\n\n\n\n

Messwerte: Tempo ohne Verlust an Denkleistung<\/h3>\n\n\n\n

Sprach-KI steht vor einem Zielkonflikt. Modelle, die im Gespr\u00e4ch komplex schlussfolgern, werden langsam. Modelle, die schnell antworten, bleiben oberfl\u00e4chlich. Deepslate l\u00f6st diesen Konflikt anders als die gro\u00dfen US-Anbieter.<\/p>\n\n\n\n