|
SpaCy en AI diensten van Google kunnen allebei een rol spelen bij tekstverwerking met Python. De praktische keuze wordt vaak pas duidelijk wanneer je kijkt naar het dagelijks beheer. Wie onderzoekt fouten, hoe worden nieuwe documenten verwerkt en hoe blijft de uitkomst controleerbaar? Door een vergelijking op te bouwen rond de volledige werkwijze voorkom je dat alleen een geslaagde demonstratie de doorslag geeft. Schrijf een kleine praktijktest uitNeem als voorbeeld een redactie die binnenkomende teksten wil voorzien van gevonden namen en onderwerpen. Beschrijf wat een medewerker met die informatie doet. Wordt zij alleen als suggestie getoond, of bepaalt zij automatisch waar een document terechtkomt? De gewenste mate van controle heeft invloed op de manier waarop je de verwerking en de beoordeling moet organiseren. Maak een testset met documenten die verschillen in lengte en schrijfstijl. Voeg ook teksten toe die buiten het normale onderwerp vallen. Die laten zien hoe de oplossing reageert wanneer de invoer niet goed aansluit op de verwachtingen. Bewaar de handmatig beoordeelde uitkomsten, zodat een latere technische wijziging op dezelfde gevallen kan worden vergeleken. Houd productnamen uit elkaarGoogle AI is een brede aanduiding en geen enkele vaste API. Kies dus eerst welke dienst en welke functie je onderzoekt. Een analyse die bestaande namen uit tekst haalt, is een andere taak dan een systeem vragen om een samenvatting te schrijven. Het gebruik van Python als verbinding tussen onderdelen maakt die taken niet onderling gelijk. SpaCy is een bibliotheek waarmee je een eigen taalverwerkingsproces opbouwt. De gekozen componenten en taalmodellen bepalen wat er gebeurt. Leg die keuze vast naast de instellingen van de clouddienst waarmee je vergelijkt. Anders kun je na een proef moeilijk verklaren welke versie precies is getest en waarom een nieuwe uitvoering andere resultaten geeft. Ontwerp een controleerbare verwerkingGeef ieder document een identificatie en bewaar de status van de verwerking. Onderscheid ontvangen, verwerkt en mislukt. Sla de bruikbare uitkomst apart op van technische foutmeldingen. Daarmee kan een medewerker zien of een leeg resultaat werkelijk betekent dat niets is gevonden, of dat de analyse helemaal niet heeft plaatsgevonden. Bepaal ook hoe je een onderbroken verwerking hervat. Reeds gecontroleerde documenten hoeven niet zomaar opnieuw door dezelfde stappen te gaan. Bewaar voldoende voortgang om alleen het ontbrekende deel af te handelen. Dit is zowel bij een lokale bibliotheek als bij een externe dienst relevant: de betrouwbaarheid van de werkwijze hangt niet uitsluitend af van het taalmodel. Maak correcties bruikbaarLaat gebruikers aangeven wat er fout is, liefst met het oorspronkelijke tekstfragment erbij. Een melding als verkeerde naam gevonden is nuttiger wanneer duidelijk is welke naam en waarom. Groepeer terugkerende problemen. Misschien gaat het steeds om eenzelfde afkorting, een bijzonder documentformaat of een categorie die onvoldoende duidelijk is omschreven. Gebruik die bevindingen om gerichte verbeteringen te onderzoeken. Bij spaCy kunnen bijvoorbeeld eigen patronen of aanvullende verwerking onderdeel van de oplossing zijn. Bij een API kan een aanpassing van de invoer of de verwerking van het antwoord helpen. Vergelijk iedere wijziging op de hele testset, zodat één opgelost voorbeeld geen onzichtbare verslechtering op andere documenten veroorzaakt. Beoordeel kosten als onderdeel van het werkMaak een inschatting van het aantal documenten en hoe vaak ze opnieuw worden verwerkt. Controleer actuele productvoorwaarden wanneer je een externe dienst overweegt. Reken daarnaast de tijd voor installatie, beheer en foutonderzoek mee. Een lokaal programma gebruikt eveneens middelen, ook wanneer er geen bedrag per verzoek wordt afgerekend. Neem bij de vergelijking ook de overdracht mee. Kan een collega de oplossing starten, een fout terugvinden en begrijpen welke instellingen belangrijk zijn? Een technisch aantrekkelijke proef kan in dagelijks gebruik lastig blijken wanneer alle kennis bij één persoon zit. Bewaar daarom een korte handleiding met de normale uitvoering en de manier waarop uitzonderingen worden afgehandeld. Leg de keuze en grenzen vastBeschrijf na de proef waarvoor de oplossing geschikt is en welke documenten extra controle nodig hebben. Noteer waarom voor een bepaalde aanpak is gekozen. Misschien weegt een eenvoudige integratie zwaar, misschien juist het beheer van de eigen verwerking. Zulke argumenten zijn waardevoller dan een algemene uitspraak dat één merk beter is. Een goede vergelijking tussen spaCy en een Google AI dienst eindigt met een uitvoerbare werkwijze. De toepassing levert bruikbare suggesties, mislukkingen blijven zichtbaar en verbeteringen worden gecontroleerd ingevoerd. Met die basis kan een team tekstverwerking verantwoord uitbreiden, zonder bij iedere verandering opnieuw te moeten uitzoeken hoe de oorspronkelijke proef eigenlijk werkte.
Sergej Dergatsjev, eigenaar van Online Solutions Group, heeft CompanyGids nieuw leven ingeblazen en het platform verder uitgebouwd tot een moderne bedrijvengids voor België. Bezoek Company Gids en Online Solutions Group. |
| https://www.dergatsjev.be/2021/02/event-over-python-machine-learning.html |
Veelgestelde vragen
Wat is het verschil tussen Spacy en Google AI voor machine learning?▼
Spacy is een open-source Python-bibliotheek gericht op natuurlijke taalverwerking, terwijl Google AI een breder ecosysteem van machine learning-tools biedt. Spacy is makkelijker voor specifieke NLP-taken, Google AI voor complexere toepassingen.
Waar wordt machine learning allemaal voor gebruikt?▼
Machine learning zit achter chatbots, voorspellende tekst, taalvertaling, Netflix-aanbevelingen, sociale media-feeds, autonome voertuigen en medische diagnoses op basis van afbeeldingen.
Welke bedrijven gebruiken machine learning in 2024?▼
Volgens Deloitte gebruiken 67% van bedrijven al machine learning. Sectoren als productie, detailhandel, bankieren en zelfs bakkerijen zetten het in om waarde te creëren of efficiëntie te verhogen.
Is Python geschikt voor machine learning projecten?▼
Ja, Python is zeer geschikt voor machine learning. Tools als Spacy en Google AI-bibliotheken werken goed met Python en bieden krachtige mogelijkheden voor NLP en predictieve modellen.
Hoe verschilt machine learning van kunstmatige intelligentie?▼
Machine learning is een deelgebied van kunstmatige intelligentie dat computers laat leren zonder expliciet programmeren. AI is het bredere concept, machine learning een specifieke toepassing ervan.
