Je kunt dit niet in drie minuten bouwen. Maar je kunt binnen een middag iets werkends hebben dat op je reageert.

De kloof tussen „AI bestaat” en „ik heb AI die precies zo werkt als ik wil” is kleiner dan die zes maanden geleden. Niet onbeduidend, maar wel kleiner. Als je hebt gewacht tot de tools volwassen zouden worden, of tot iemand het belachelijk eenvoudig zou maken, dan is dit het moment.

Waarom zou je de moeite nemen om je eigen te bouwen?

De kant-en-klare assistenten doen heel veel dingen. Ze doen jouw dingen op de manier waarop je ze eigenlijk zou willen doen. Een speciaal ontwikkelde spraakassistent – eentje die weet wat je prioriteiten zijn, zorgt voor je werkprocessen, spreekt in jouw stijl – is iets dat je zowel niet kunt kopen als (nog) huren. Je moet het in elkaar zetten.

Het is ook geen vaporware meer. De componenten zijn stabiel. Integratie vergt echt werk, maar het heeft een duidelijk einddoel.

Wat je eigenlijk aan het bouwen bent

Een spraak-interface voor Claude die:

Het is helemaal niet te vergelijken met de monolithische AI-personages in sciencefictionfilms. Het zijn vier diensten die aan elkaar zijn geplakt met wat code. Elk van deze doet één ding goed, en samen creëren ze iets dat aanvoelt als een gesprek met een echte persoon die toevallig heel georganiseerd is en en zeel zeel zeel zeel zeel zeel zeel zeel zeel zeel zeel zeel zeel zeel zeel zeel zeel zeel zeel zeel zeel zeel zeel zeel zeel zeel zeel erg georganiseerd is en nooit iets vergeet.

De toolkit

Claude Code (gratis met een Claude abonnement, of als een betaalde CLI-tool)
Dit is jouw orchestrator. Hier kun je een prompt plakken, vragen stellen over wat je assistent eigenlijk moet doen, en kijken hoe de code wordt gegenereerd die alles aan elkaar verbindt. Je hebt de desktopversie of de betaalde CLI nodig. Als je serieus bent over dit, geef dan die € 20 per maand uit. Het is niet het duurste onderdeel van wat je van plan bent te doen.

ElevenLabs (€ 5–€ 29/maand afhankelijk van het gebruik)
Dit geeft je assistent een stem. Blader door hun stembibliotheek, kies er één die je niet de neiging geeft om het project op te geven, kopieer de stem-ID, en voeg deze in je code in. Het goedkopere abonnement levert je 10.000 tekens per maand. Dat is genoeg voor testen en licht gebruik. Als je iets wilt dat constant praat, stap dan over naar het tarief van € 29.

DeepGram (€ 12 per maand, of op basis van daadwerkelijk gebruik vanaf ongeveer $ 0,0043 per minuut)
Dit zet je spraak om in tekst. Je hebt een API-sleutel nodig. Het is echt goed in het begrijpen van gesproken taal, hallucineert niet, en zal geen accenten of achtergrondgeluid verkeerd interpreteren dan elk alternatief.

Claude API (pay-as-you-go; ongeveer € 0,30 per 1 miljoen ingevoerde tokens, € 1,20 per 1 miljoen uitgegeven tokens)
Het werkelijke ’s brein van je Claude via de API is goedkoper dan Claude via de website. Claude via de API is goedkoper dan Claude via de website, maar je moet aan het verbruik van tokens denken —vooral als je assistent continu draait. Reken op € 10–30 per maand voor matig gebruik; meer als de assistent acht uur per dag actief is.

Een lokale map op jecomputer waarop de code staat en waarop jouw assistent draait.

Totaal per maand: ongeveer € 40–60 als je met weinig begint, minder als je zuinig bent.

Het eigenlijke proces

Stap één: Installeer Claude Code
Download de desktopversie. Open deze. Maak een nieuwe map aan voor al je bestanden.

Stap twee: Ga naar de basisprompt
Frameworks die er zijn, zorgen voor de opbouw voor jou. In plaats van helemaal vanaf nul te bouwen, gebruik deze degelijke prompt die de structuur van een AI-agent beschrijft; kopieer het, plak het in Claude Code, en klik op “planmodus”.

Claude Code zal je een reeks vragen stellen. Hoe moet je assistent heten? Wat is zijn belangrijkste doel? Wat vindt hij belangrijk? (Hier bepaal je zijn persoonlijkheid, niet achteraf.) Op welke tijden moet hij werken? Tot welke hulpmiddelen moet hij toegang hebben? Je beantwoordt deze vragen en het systeem genereert een persoonlijkheidsprofiel voor je assistent dat daadwerkelijk bepalend is voor hoe hij zich gedraagt.

Stap drie: Kies een stem
Ga naar ElevenLabs, blader door de stemmen (het duurt langer dan nodig is om een stem te kiezen; denk er niet te lang over na), kopieer de stem-ID en plak deze in Claude Code wanneer dat wordt gevraagd.

Stap vier: Zorg voor uw spraakherkenning
Maak een DeepGram-account aan, genereer een API-sleutel , en kopieer deze naar Claude Code.

Stap vijf: Laat Claude Code bouwen
Dit duurt een paar minuten. Het genereert Python-code die deze diensten met elkaar verbindt, de authenticatie verzorgt, de conversatielus beheert en ervoor zorgt dat de audio-in- en -uitgang goed werken.

Stap zes: Test het lokaal
Zodra het klaar is, zal Claude Code je vragen om een localhost te draaien. Dit start een webserver op je computer. Open deze in een browser. Je zou een eenvoudige interface moeten zien. Klik op de microfoonknoppen, spreek, en luister naar een reactie. Als het reageert, heb je het gebouwd.

Het onzichtbare werk

Wat dit eigenlijk bruikbaar maakt, is de promptengineering. De eerste vragen die Claude Code je stelt — over de doelen, persoonlijkheid en beperkingen van je assistent — worden samengevoegd tot een gedetailleerde systeemprompt die Claude leest bij elke uitwisseling. Die prompt doet het zware werk. Als je je assistent beschrijft als “een persoon die prioriteit geeft aan duidelijkheid en beknoptheid,” dan zal dat ook zo zijn. Als je zegt “leg altijd je redenering uit,” dan zal dat gebeuren.

Stem en persoonlijkheid zijn met elkaar verbonden. Een stem zoals die van Morgan Freeman past goed als je assistent bedachtzaam en beheerst is. Een heldere, energieke stem bij iets dat is ontworpen om droog en kritisch te zijn is schokkend. Besteed echt tijd aan deze keuze; je zult het voortdurend horen.

Hoe het eigenlijk voelt

Je bent niet in gesprek met een chatbot. De stem, de reactietijd (meestal minder dan twee seconden) en het feit dat het gepersonaliseerd is op basis van jouw werkelijke doelen creëren iets dat anders aanvoelt. Je brein accepteert het als een hulpmiddel waarmee je samenwerkt, niet als iets waar je gebruik van maakt.

Het is ook nog steeds echt beperkt. Het zal je agenda zijn, tenzij je code schrijft om je agenda-API te koppelen. Het zal geen acties in de echte wereld veroorzaken, tenzij je het expliciet koppelt aan iets. Wat het zal doen, is luisteren, nadenken, en reageren op een manier die samenhangend en oprecht behulpzaam is. Voor sommige werkprocessen, is dat voldoende. Voor anderen is het een uitgangspunt.

Het moeilijke deel

Het moeilijke deel is niet de installatie. Het is beslissen wat je eigenlijk het moet doen. Want zodra je een spraakinterface hebt voor Claude, moet je duidelijk zijn over je instructies, je beperkingen, en wat belangrijk is. De meeste mensen vermijden deze duidelijkheid, zelfs wanneer ze alleen maar prompts in ChatGPT schrijven. Met iets dat je zelf bouwt en beheert, kun je het niet overslaan.

Die duidelijkheid—uitzoeken precies wat je nodig hebt, hoe je het zou formuleren tegenover een persoon, wat je zou willen dat zij het optimaliseren voor —is de moeite waard voor de middag die het kost om dit op te zetten.

Het stemgedeelte is bijna een bijproduct.

Geef een reactie

Registreer

Blijf op de hoogte van de laatste ontwikkelingen in de wereld van kunstmatige intelligentie. Met een account kun je ook jouw beoordeling en recensie achterlaten, wat bijdraagt aan de kennis en ervaring van de community.

Welcome to Wauw AI